GPT-6 Astra gagne en précision sur la manipulation robotique
Dans un test interne publié le 4 septembre 2026, GPT-6 Astra d’OpenAI a mieux réussi une tâche de prise et dépôt qu’un modèle Claude Fable 5.1. L’écart est net sur le bac, beaucoup moins sur le puzzle, où tous butent au même endroit.
OpenAI a soumis GPT-6 Astra au même banc d’essai robotique que Claude Fable 5 et Fable 5.1, avec des bras YAM identiques et deux tâches de manipulation, selon une publication datée du 4 septembre 2026. Sur l’exercice du bloc à placer dans un bol, Astra a réussi 19 essais sur 20, contre 8 sur 20 pour Fable 5.1. Sur le puzzle, le modèle d’OpenAI n’a pas pris l’avantage et reste bloqué au même stade final que ses concurrents. L’enjeu dépasse le simple score : il s’agit de savoir quels modèles peuvent piloter un robot sans multiplier les essais, donc sans faire grimper le temps et la facture.
Sur le bloc dans le bol, Astra prend l’avantage
Le test le plus favorable à GPT-6 Astra est aussi le plus parlant. Sur la tâche « Pick up the red block from the table and place it inside the bowl », le modèle d’OpenAI atteint un taux de réussite de 95 %, avec un temps moyen de 2,5 minutes par essai et un coût estimé à 0,94 dollar par run. Fable 5.1, lui, s’arrête à 40 % de réussite, pour 6,8 minutes et 2,12 dollars. Fable 5 fait encore moins bien, avec 5 % de réussite et 2,69 dollars par essai. Autrement dit, Astra ne se contente pas de mieux faire ; il le fait plus vite et moins cher, ce qui compte beaucoup quand un robot répète la même geste des dizaines de fois. Oui, même les bras robotisés ont le droit d’être pressés.
Le protocole décrit un scoring par paliers : contact avec l’objet, levage, positionnement au-dessus de la zone de dépôt, puis placement final. Astra obtient une moyenne de 3,95 sur 4 sur la tâche du bol, contre 2,40 pour Fable 5.1 et 1,30 pour Fable 5. La publication précise aussi que les temps affichés retirent les pauses de réflexion du modèle, afin de mesurer le temps réellement écoulé.
Le puzzle rappelle qu’un bras robotique n’aime pas les demi-tours
La seconde tâche raconte une histoire moins flatteuse pour tout le monde. Sur « Pick up the round blue puzzle piece by the knob at its center and place it into the matching circular groove in the board », Astra réussit 2 fois sur 20, exactement comme Fable 5.1, tandis que Fable 5 reste à 0 sur 20. Les trois modèles parviennent à atteindre la rainure, mais s’y arrêtent au moment décisif. La différence de coût existe encore en faveur d’Astra, à 1,36 dollar par run contre 2,18 dollars pour Fable 5.1, mais la supériorité fonctionnelle disparaît presque totalement.
Ce point est important pour les usages industriels et logistiques, où une manipulation partiellement correcte ne suffit pas. Un robot qui aligne bien sa pince mais échoue sur l’insertion finale peut ralentir une ligne entière. Dans ce contexte, la publication montre surtout qu’un bon score sur une tâche simple ne garantit rien sur une tâche légèrement plus fine. Le poignet mécanique, lui, ne triche pas.
Des chiffres encourageants, mais un protocole à lire de près
Les auteurs signalent plusieurs limites. Les essais d’Astra ont eu lieu deux jours après ceux de Fable, sans alternance. La comparaison du puzzle s’est faite sur le même banc d’essai, mais pas celle du bloc dans le bol : les essais Fable ont été menés sur le rig-3, indisponible pour Astra, qui a utilisé le rig-1. Les notes indiquent aussi que l’évaluation a été faite par un opérateur connaissant le modèle, ce qui ouvre la porte à un biais inconscient [à vérifier].
Autre nuance : les coûts sont calculés au prix catalogue, avec 10 dollars par million de jetons d’entrée et 50 dollars par million de jetons de sortie. OpenAI a, en plus, bénéficié d’une mise en cache automatique d’environ un cinquième de ses jetons d’entrée, non déduite dans le calcul. Le coût d’Astra est donc probablement surestimé, selon la note technique. À ce stade, la conclusion la plus solide est simple : sur une tâche de prise et dépôt relativement directe, GPT-6 Astra paraît plus efficace que Fable 5.1 ; sur une tâche de précision, l’écart se referme.
Points clés
- GPT-6 Astra réussit 19 essais sur 20 sur la tâche du bol.
- Fable 5.1 atteint 8 réussites sur 20 sur le même test.
- Sur le puzzle, Astra et Fable 5.1 finissent à 2 sur 20.
- Les essais ont été publiés le 4 septembre 2026.
- Inspect Robots 0.58.0 a servi de cadre de test.
- OpenAI a testé Astra avec un budget de 20 appels LLM.
En chiffres
- 95 % — réussite d’Astra sur le bloc dans le bol, 20 essais, publication du 4 septembre 2026.
- 40 % — réussite de Fable 5.1 sur la même tâche, 20 essais, même source.
- 2,5 minutes — temps moyen d’Astra par essai sur le bol, même source.
- 0,94 dollar — coût estimé par run d’Astra sur le bol, au prix catalogue.
- 2 sur 20 — réussite d’Astra sur le puzzle, au même niveau que Fable 5.1.