OpenAI mise sur Cerebras pour accélérer GPT-5.6 Sol
OpenAI lance Ultrafast, une offre d’inférence en preview qui fait tourner GPT-5.6 Sol jusqu’à 14 fois plus vite que le mode Standard. Le service s’appuie sur Cerebras et vise les usages où chaque seconde compte.
OpenAI a lancé le 13 août 2026 Ultrafast, un nouveau niveau de service API qui fait tourner son modèle phare GPT-5.6 Sol sur du matériel Cerebras. Selon l’entreprise, la vitesse grimpe jusqu’à 750 jetons de sortie par seconde et jusqu’à 14 fois plus vite que le traitement Standard. La promesse est simple : rendre utilisable en temps réel un modèle de pointe, sans le laisser coincé dans des tâches de fond qui prennent la nuit entière.
Un test grandeur nature pour l’inférence à très faible latence
Ultrafast est d’abord proposé en aperçu limité à un groupe restreint de clients, puis son accès doit s’élargir avec la capacité disponible. OpenAI cible des usages où la latence pèse directement sur la valeur produite : réponse à incident pendant qu’une panne se déroule, recherche financière quand les marchés bougent, support client vocal ou boucle de recherche en direct. Dans ce contexte, la vitesse n’est pas un bonus décoratif. C’est le service lui-même.
Le lancement s’inscrit aussi dans la montée en puissance d’un partenariat de 10 milliards de dollars en calcul à faible latence, annoncé plus tôt en 2026 entre OpenAI et Cerebras. OpenAI présente Ultrafast comme « the next step » de cette collaboration. Pour Cerebras, c’est une vitrine rare : faire héberger le modèle phare d’OpenAI sur son architecture wafer-scale, là où les clouds GPU dominent encore le marché.
Pourquoi Cerebras revendique un avantage de vitesse
Le cœur de l’argument tient à la mémoire, pas seulement au calcul. Sur des GPU classiques, les poids d’un modèle doivent circuler entre mémoire embarquée et stockage externe à chaque génération de jeton, ce qui finit par plafonner les performances. Cerebras dit contourner ce goulet d’étranglement avec sa Wafer-Scale Engine, un composant qui embarque 44 Go de SRAM sur une seule puce à l’échelle d’un wafer. Les poids restent ainsi sur la puce, ce qui réduit la latence de façon très directe.
Cette approche est aussi celle que l’entreprise met en avant pour expliquer pourquoi ses gains tiennent avec la taille des modèles. Plus le modèle grossit, plus le coût de déplacement de la mémoire devient sensible. Or l’inférence, c’est précisément l’art de nourrir le calcul assez vite pour que le modèle ne s’essouffle pas. La phrase est moins glamour qu’un slogan de keynote, mais elle résume le sujet.
Des chiffres impressionnants, mais issus de tests maison
Cerebras publie plusieurs comparaisons pour défendre Ultrafast. L’entreprise dit que GPT-5.6 Sol y est 11 fois plus rapide que Claude Fable 5 et 5 fois plus rapide qu’Opus 4.8 en mode Fast, selon les mesures d’Artificial Analysis qu’elle cite. Sur Humanity’s Last Exam, un benchmark de 2 500 questions de niveau doctorat, GPT-5.6 Sol sur Ultrafast aurait terminé en 11 heures et 11 minutes, contre 78 heures et 27 minutes pour Claude Fable 5, soit près de 7 fois moins vite dans la lecture de Cerebras.
Autre chiffre avancé : sur GDP-Val, un benchmark consacré à des tâches de travail intellectuel à valeur économique, Cerebras rapporte un gain de vitesse de 5,6 fois de bout en bout par rapport au mode Standard, sans dégradation de la qualité. Ces résultats doivent toutefois être lus avec prudence. Les deux comparaisons ont été réalisées par Cerebras elle-même, les 10, 13, 14 et 15 juillet 2026 pour Humanity’s Last Exam, puis le 31 juillet 2026 pour GDP-Val. Ce sont des mesures éditeur, pas des validations indépendantes.
Qui y a accès pour l’instant ?
OpenAI a ouvert l’aperçu à quelques clients seulement, dont Jane Street, Podium, Basis et Rogo, dans des domaines allant du code à la finance en passant par le commerce. John Crepezzi, responsable AI Assistants chez Jane Street, a déclaré dans l’annonce d’OpenAI : « The increase in speed brought by Cerebras is impressive, » puis « It enables different ways of using the models, and makes it practical for developers to work in a more focused and productive way alongside them. »
Le déploiement reste volontairement mesuré. OpenAI dit vouloir observer où un bond d’un ordre de grandeur en vitesse crée le plus de valeur avant d’élargir l’accès. En clair, la capacité disponible fera office de feux tricolores. Et pour l’instant, personne ne parle d’un buffet à volonté.
Ce que ce lancement change pour le marché
Cette annonce pèse moins pour sa démonstration technique que pour ce qu’elle dit du marché des accélérateurs. Cerebras obtient une référence de production au sommet de la pile OpenAI, au moment où les fournisseurs de GPU cherchent eux aussi à intégrer davantage de modèles dans leur propre silicium. Si Ultrafast tient ses promesses en usage réel, cela renforcera l’idée qu’une architecture spécialisée peut encore battre les solutions généralistes sur la latence, au moins sur certains cas.
Reste une inconnue simple : la disponibilité. Ultrafast est un aperçu limité, sans calendrier public pour un déploiement large. La suite dépendra donc moins du discours sur la capacité à « servir » des modèles frontière que de la vitesse à laquelle OpenAI et Cerebras réussiront à la rendre accessible.
Points clés
- 13 août 2026 : lancement d’Ultrafast dans l’API OpenAI.
- 750 jetons de sortie par seconde annoncés sur GPT-5.6 Sol.
- OpenAI parle d’un gain jusqu’à 14 fois sur Standard.
- Jane Street figure parmi les premiers clients cités.
- Cerebras revendique 44 Go de SRAM sur une puce wafer-scale.
- Le partenariat OpenAI-Cerebras atteint 10 milliards de dollars.
En chiffres
- 2 500 questions — benchmark Humanity’s Last Exam, selon Cerebras, juillet 2026.
- 11 h 11 — temps revendiqué pour GPT-5.6 Sol sur Ultrafast, juillet 2026.
- 78 h 27 — temps revendiqué pour Claude Fable 5, juillet 2026.
- 5,6 fois — gain de vitesse end-to-end sur GDP-Val, selon Cerebras.
- 10 milliards de dollars — capacité de calcul à faible latence liée au partenariat, 2026.