Ultrafast accélère GPT-5.6 Sol sans changer le modèle
OpenAI teste Ultrafast, un mode d’inférence réservé à l’API qui promet jusqu’à 14 fois plus de vitesse pour GPT-5.6 Sol. Le service vise quelques clients triés sur le volet, avec un prix encore inconnu.
OpenAI a ouvert le 13 août un aperçu limité d’Ultrafast, un nouveau mode de service pour son API qui garde le même modèle, GPT-5.6 Sol, mais réduit fortement le temps de réponse. L’accès reste réservé à quelques entreprises, sans tarif annoncé à ce stade. L’enjeu est concret : faire disparaître la latence là où chaque seconde perdue coûte du temps, parfois de l’argent.
Le modèle ne change pas, le temps de réponse si
Ultrafast ne promet pas un cerveau plus fort, seulement un cerveau plus prompt. Le principe repose sur le même GPT-5.6 Sol, servi jusqu’à 14 fois plus vite que le traitement standard, avec un débit annoncé pouvant monter à 750 unités de texte générées par seconde. OpenAI précise qu’il s’agit d’une mesure maison, sans vérification externe publiée à ce jour [à vérifier].
Le gain vient de Cerebras, un fabricant américain connu pour ses puces de très grande taille, gravées sur une galette de silicium entière plutôt que découpées en composants plus petits. Ce choix limite les échanges internes qui ralentissent habituellement les systèmes répartis sur plusieurs cartes graphiques. Résultat : moins d’attente entre une question et une réponse. L’IA ne devient pas plus bavarde, elle cesse surtout de faire patienter son interlocuteur.
À qui sert vraiment ce mode turbo ?
OpenAI lance Ultrafast d’abord dans l’API, l’interface utilisée par les développeurs pour brancher des modèles sur leurs propres services. Les premiers accès sont restreints à un petit groupe de clients, puis l’entreprise prévoit d’élargir la disponibilité à mesure que la capacité augmente. Parmi les premiers testeurs figurent Jane Street, ainsi que des acteurs de la relation client et de la comptabilité.
L’éditeur vise les usages où le délai compte plus que tout : réponse à des incidents informatiques, débogage, recherche financière, détection de fraude, support client en temps réel, applications vocales et commerce en ligne. Dans ces scénarios, une réponse tardive n’est pas seulement moins agréable. Elle peut devenir inutile.
OpenAI donne aussi un exemple interne parlant. Pendant un incident technique, ses équipes font analyser en direct les journaux d’activité, les traces et les échanges internes, puis préparent des correctifs avant validation humaine. Côté recherche, des boucles d’expérimentation qui prenaient toute la nuit peuvent désormais être répétées plusieurs fois dans une seule journée de travail.
Le vrai sujet, c’est le prix de la vitesse
OpenAI n’a annoncé aucun tarif pour Ultrafast. Mais sa grille actuelle donne un indice clair : la vitesse se facture déjà. Son mode rapide, rebaptisé fin juillet, monte jusqu’à 2,5 fois la cadence standard et est vendu plus cher que le tarif normal, tandis que les formules à latence variable coûtent moitié moins. Ultrafast grimpe encore d’un cran, avec un niveau de performance qui le place près de six fois au-dessus de ce mode rapide, lui-même facturé en supplément.
Pour Cerebras, l’accord sert aussi de vitrine. L’entreprise, entrée en Bourse cette année, cherchait à montrer que ses puces géantes ne servent pas seulement aux démonstrations. OpenAI, de son côté, réduit un peu sa dépendance à Nvidia. Et pour les utilisateurs finaux, le changement se verra plus tard, dans des assistants vocaux qui laissent moins de blancs et des services clients qui répondent à la vitesse d’une conversation. Le marché, lui, comprend déjà le message : le temps de réponse devient une variable de compétition à part entière.
Points clés
- Ouverture limitée le 13 août dans l’API OpenAI.
- GPT-5.6 Sol reste identique, seul l’accès change.
- Jusqu’à 14 fois plus vite selon OpenAI.
- Jusqu’à 750 unités de texte par seconde.
- Jane Street figure parmi les premiers testeurs.
- Cerebras fournit le matériel de calcul.
En chiffres
- 13 août — date d’ouverture de l’aperçu limité, selon OpenAI.
- 14 fois — accélération annoncée par rapport au traitement standard.
- 750 unités de texte/seconde — débit maximal mis en avant par OpenAI.
- 2,5 fois — cadence du mode rapide actuel d’OpenAI.
- 50 % — réduction de prix des formules à latence variable, selon la grille actuelle.