Des modèles d’IA au volant d’une Toyota Corolla, et la route reste longue

Un test DrivingBench a placé plusieurs modèles d’IA générative aux commandes d’une Toyota Corolla sur un parcours en parking. Un seul est allé au bout, mais à très basse vitesse et avec un coût de calcul non négligeable.

Trois modèles d’IA générative, dont GPT-6 Astra, Grok 4.6 et Claude Fable 5.1, ont été testés aux commandes d’une Toyota Corolla dans un parcours fermé de parking, dans le cadre du projet DrivingBench. Selon les chercheurs, un seul modèle a terminé le trajet, et seulement à très basse vitesse. Le résultat compte, car il mesure à quel point les grands modèles de langage restent fragiles dès qu’ils doivent piloter un véhicule réel, même dans un environnement simple.

Quand l’IA découvre qu’un cône de chantier n’est pas un détail

Le principe du test était simple : un ordinateur portable relié à un boîtier comma four envoyait des commandes au véhicule à partir de la télémétrie GPS et d’indicateurs comme l’angle du volant ou des pneus. Les modèles recevaient donc des données de conduite, puis produisaient des ordres pour la direction, l’accélération et le freinage. Rien de spectaculaire en apparence. Sauf qu’en conduite, les détails comptent vite plus que les démonstrations de force.

Le projet, nommé DrivingBench, visait à voir si des modèles frontaliers pouvaient réussir à boucler un petit circuit. D’après la publication relayée sur X, seuls les essais de GPT-6 Astra sont allés jusqu’au bout, et au second essai seulement. Le véhicule a parcouru moins de 500 pieds, soit environ 152 mètres, en cinq minutes. Les autres modèles ont échoué bien plus tôt, souvent avant le premier virage.

Les chercheurs citent surtout des erreurs de perception : distinguer le bon côté d’une ligne de cônes ou comprendre qu’un espace paraît plus étroit qu’il ne l’est réellement. Grok l’a résumé sans détour : “The car is wider than the camera makes it look”. Dans ce contexte, le problème n’est pas la théorie du pilotage. C’est la lecture du réel, encore bancale dès qu’un obstacle sort du scénario attendu.

Des modèles prudents, parfois trop

Le test révèle aussi un autre point, moins attendu : certains modèles ont refusé de prendre le contrôle du véhicule. Les chercheurs indiquent que GPT-6 Astra, en particulier, a parfois opposé des raisons de sécurité, même dans un parking vide et avec une vitesse plafonnée. Ils disent avoir tenté plusieurs reformulations de prompt, y compris en parlant de “simulation”, sans résultat stable. À un moment, le modèle a compris que la scène était bien réelle et a commencé à réagir en conséquence. L’IA a donc eu le réflexe de freiner. Pas toujours au bon moment, mais le réflexe était là.

Ce mélange de prudence et d’approximation dit beaucoup de l’état actuel de ces systèmes. Ils peuvent impressionner sur des tâches textuelles, mais la conduite réclame une continuité d’attention, une lecture fine de l’espace et une gestion du risque en temps réel. Les chercheurs concluent d’ailleurs que les modèles frontaliers ont progressé au point de pouvoir conduire des véhicules réels à très faible vitesse, mais que cela appelle encore un travail urgent sur la sécurité, l’alignement et l’évaluation.

Un succès coûteux pour moins de 500 pieds

Le test réussi n’a rien d’un tour de piste bon marché. Les chercheurs disent avoir dépensé 7,74 dollars pour 6,6 millions de tokens lors de l’inférence du parcours complet. Le véhicule roulait à 0,94 mph, soit environ 1,5 km/h. Autant dire une allure de piéton très décidé. Le coût de calcul, lui, dépasse largement le coût de l’essence sur un trajet aussi court, ce qui rappelle qu’en IA, le mot “autonome” reste souvent synonyme de facture salée.

Pour le marché, l’intérêt du test est clair. Les systèmes embarqués de conduite assistée ou autonome ne se jugent pas seulement sur des scores de laboratoire, mais sur leur capacité à éviter le faux pas le plus banal : un marquage mal lu, une barrière, une zone de travaux. Tant que les modèles généralistes ne tiendront pas ce niveau de robustesse, ils resteront loin d’une utilisation routière courante. Et c’est sans doute mieux ainsi.

Points clés

  • DrivingBench a testé des modèles d’IA dans une Toyota Corolla.
  • GPT-6 Astra a terminé le parcours au second essai.
  • Le trajet complet a duré cinq minutes, à 0,94 mph.
  • Les autres modèles ont échoué avant le premier virage.
  • Les chercheurs appellent à renforcer sécurité et évaluation.
  • Publication relayée sur X le 21 septembre 2026.

En chiffres

  • 3 modèles — GPT-6 Astra, Grok 4.6, Claude Fable 5.1 testés par DrivingBench.
  • 1 modèle — seul GPT-6 Astra a terminé le parcours, selon les chercheurs.
  • 152 mètres — distance approximative parcourue en moins de 500 pieds.
  • 7,74 dollars — coût d’inférence annoncé pour 6,6 millions de tokens.
  • 0,94 mph — vitesse du véhicule lors du test réussi.

À lire