Mardi 11 août 2026
Édition nº 412 · ParisIndice d'attention IA : 11 articles / 7 j
Fil actif — 17:40
Le quotidien de
l'intelligence artificielle

ia-actualité.fr

Modèles · Recherche
Régulation · Usages

Décryptage · Modèles

OpenAI branche GPT-5.6 Sol sur Cerebras : la vitesse d'inférence devient un champ de bataille

OpenAI ouvre une préversion « Ultrafast » de GPT-5.6 Sol propulsée par les puces wafer-scale de Cerebras : jusqu'à 750 tokens par seconde et 14 fois plus rapide.

Image d'illustration — gros plan sur un wafer de silicium, dont chaque carré deviendra une puce.
Image d'illustration — gros plan sur un wafer de silicium, dont chaque carré deviendra une puce.Photo : Laura Ockel / Unsplash

Un même modèle, la même intelligence, mais rendu au triple de la cadence : c'est la promesse qu'OpenAI a mise sur la table le 13 août avec Ultrafast, un nouveau palier de service pour son modèle de raisonnement GPT-5.6 Sol. Derrière le gain, un choix de matériel inhabituel : ce n'est pas un GPU Nvidia qui fait tourner la préversion, mais les puces « wafer-scale » de Cerebras, qui a confirmé le partenariat le même jour. Le message est clair : après la course à la taille et à la qualité des modèles, un troisième front s'ouvre, celui de la vitesse brute de génération.

Ce que change « Ultrafast »

Ultrafast ne modifie ni les poids ni les capacités de GPT-5.6 Sol : OpenAI insiste sur le fait que le modèle conserve exactement la même intelligence que la version Standard. Ce qui change, c'est le débit. La préversion atteint jusqu'à 750 tokens générés par seconde, soit environ quatorze fois plus vite que le mode Standard sur les mêmes requêtes. Pour un modèle de raisonnement — dont la lenteur perçue vient justement des longues chaînes de « réflexion » qu'il déroule avant de répondre — c'est la différence entre un outil qu'on lance et qu'on laisse mouliner, et un outil qui suit le rythme d'une conversation.

Les comparaisons mises en avant par les deux entreprises situent l'enjeu concurrentiel. Selon Cerebras, GPT-5.6 Sol en Ultrafast tourne onze fois plus vite que Claude Fable 5 et cinq fois plus vite que Claude Opus 4.8 en mode Fast. Sur le benchmark Humanity's Last Exam, l'écart de temps devient spectaculaire : là où Fable 5 met plus de 78 heures à boucler l'épreuve, la configuration Ultrafast la termine en un peu plus de 11 heures, un facteur sept. Sur GDP-Val, un test qui mesure des tâches économiques de bout en bout, Cerebras revendique une accélération de 5,6 fois « sans dégradation qualitative ».

750
Tokens générés par seconde en préversion
14x
Accélération face au mode Standard
44 Go
Mémoire SRAM embarquée sur la puce Cerebras

Pourquoi le wafer-scale accélère

La performance tient à une architecture matérielle à contre-courant de l'industrie. Un GPU classique déporte une grande partie des poids du modèle dans une mémoire externe et passe son temps à faire des allers-retours entre calcul et mémoire : ce va-et-vient est le principal goulet d'étranglement de l'inférence. Cerebras fabrique au contraire une puce de la taille d'un wafer entier de silicium, dotée de 44 Go de mémoire SRAM directement intégrée au calcul. Résultat, une bonne partie des transferts coûteux disparaît, et les tokens sortent en flux quasi continu. C'est cette même approche qui avait déjà permis à Cerebras de battre des records de débit sur des modèles ouverts ; l'accord avec OpenAI la fait entrer, pour la première fois à cette échelle, dans la pile d'un laboratoire de premier plan.

Les cas d'usage cités par OpenAI ne sont pas anodins : agents autonomes en temps réel, diagnostic d'incidents de production, détection de menaces en cybersécurité, mais aussi rédaction de mémos juridiques ou construction de modèles financiers. Le point commun : des scénarios où l'attente casse le flux de travail. « Avec GPT-5.6 Sol Ultrafast, Cerebras permet une IA qui suit votre rythme de réflexion et de collaboration », résume Rohan Varma, responsable produit chez OpenAI. Un de ses chercheurs, Jeffrey Wang, le formule plus crûment : les tâches « se terminent maintenant avant même que je puisse changer de contexte ».

Le prix de la vitesse reste flou

Reste la question que ni OpenAI ni Cerebras ne tranchent : combien ça coûte. Ultrafast est pour l'instant réservé à une préversion sur liste d'attente, ouverte à un petit groupe de clients, sans date de disponibilité générale ni tarif annoncé. À titre de repère, GPT-5.6 Sol en version Standard est facturé 5 dollars par million de tokens en entrée et 30 dollars en sortie — et l'histoire récente de l'inférence accélérée suggère que la vitesse se paie. La vraie inconnue commerciale est là : à quel surcoût la cadence Ultrafast devient-elle rentable pour un agent qui enchaîne des milliers d'appels.

L'annonce éclaire aussi un angle mort de la souveraineté européenne. La course à la vitesse d'inférence est d'abord une course au matériel, et elle se joue aujourd'hui entre acteurs américains — Nvidia, et désormais son challenger Cerebras. Les efforts européens se concentrent pour l'instant sur la localisation de la capacité, comme l'infrastructure d'inférence régionale que Mistral déploie en Europe, davantage que sur une alternative aux puces elles-mêmes. Or si les agents temps réel deviennent la norme, la maîtrise du silicium qui les fait tourner pèsera autant que celle des modèles.

Pour les développeurs français qui construisent des agents, la leçon est double. À court terme, la vitesse d'inférence devient un critère de choix aussi sérieux que la qualité ou le prix d'un modèle. À plus long terme, elle rappelle que la dépendance ne s'arrête pas aux modèles : elle descend jusqu'à la puce.