Claude Opus 5.5 vise les tâches de bout en bout en codage
Anthropic lance Claude Opus 5.5, premier modèle de sa nouvelle famille 5.5. Le modèle promet 40 % de coût en moins sur des charges typiques, tout en visant davantage les tâches complètes de développement.
Anthropic a lancé Claude Opus 5.5, premier modèle de sa nouvelle famille Claude 5.5, avec une ambition nette : prendre en charge des tâches de développement de bout en bout, du design au débogage. Selon la société, il atteint le niveau de Claude Fable 5.1 sur la plupart des travaux, tout en coûtant environ 40 % de moins à l’usage sur des charges typiques. Le sujet compte pour les équipes produit comme pour les plateformes cloud, car le modèle n’est disponible qu’en API managée, pas en poids ouverts. Autrement dit, pas de self-hosting, mais des appels via la Claude Platform, AWS, Google Cloud et Microsoft Azure.
Un modèle pensé pour finir, pas juste commencer
Anthropic présente Opus 5.5 comme un outil capable d’avancer sur des migrations de code, des audits et des tâches longues sans casser le rythme. Dans les retours d’essais cités par l’entreprise, un audit de 200 000 lignes a été corrigé en moins de trois heures, quand Opus 5 aurait mis plus de 20 heures et consommé 2,5 fois plus de jetons. Sur un portage interne de HAProxy de C vers Rust, Opus 5.5 a terminé en 9,5 heures contre 12 heures pour Fable 5.1, avec une facture inférieure de 51 %.
Le changement ne tient pas seulement au score brut. Anthropic insiste sur le fait que le modèle utilise moins de calcul pour servir, réduit le nombre de jetons nécessaires par tâche et améliore la vitesse de génération de plus de 30 % par rapport à Opus 5. Les prix annoncés descendent à 4 dollars par million de jetons en entrée et 20 dollars en sortie, avec des lectures de cache à 0,20 dollar. Pour les usages agentiques et de codage, ce cache pèse lourd ; sa baisse de 60 % explique une part importante de l’économie affichée.
Des gains mesurés, mais pas un triomphe total
Les benchmarks publiés montrent un modèle solide, sans écraser tous ses rivaux. Opus 5.5 obtient 66,4 % sur Terminal-Bench 4.0, 54,4 % sur FrontierCode v1.1, 57,8 % sur CursorBench 4.0 et 81,8 % sur OSWorld 2.0. Sur GDPval-AA v2.1, il monte à un Elo de 1846. En face, GPT-6 Astra garde l’avantage sur certains tests, notamment Terminal-Bench-Science 0.1 et AutomationBench. Anthropic prévient d’ailleurs que les marges de benchmark deviennent un guide moins fiable qu’avant.
À effort moyen, le tableau économique devient plus parlant. Sur FrontierCode, Opus 5.5 atteint 54,6 % au réglage par défaut, au-dessus du meilleur score de GPT-6 Astra, à environ un cinquième du coût par tâche. Sur CursorBench, il monte à 52,5 %, soit 11 points de plus que le meilleur score de GPT-5.6 Sol, pour environ un tiers du coût. Le message est clair : dans ce marché, le rapport performance-prix pèse parfois plus que la ligne de score pure. Le tableur a encore de beaux jours devant lui, malheureusement pour ceux qui rêvaient d’un monde sans colonnes.
Des garde-fous renforcés, et quelques restrictions en plus
Anthropic a testé le modèle avec des évaluateurs externes, dont METR et Frontier Design, avant la publication. L’entreprise dit aussi qu’Opus 5.5 obtient son meilleur score à ce jour sur son audit comportemental automatisé, qui couvre près de 2 000 scénarios. Dans un test de confinement, le modèle aurait tenté de contourner des limites environ 85 % moins souvent qu’Opus 5. Les capacités en biologie et cybersécurité restent comparables à celles de Claude Mythos 5.1, avec des règles proches de Fable 5.1.
Concrètement, cela se traduit par plusieurs contraintes. Le raisonnement ne peut plus être désactivé, et les sorties sont watermarkées pour répondre aux exigences de conformité du règlement européen sur l’IA. Côté cybersécurité, les demandes de correction de bugs restent possibles, mais la plupart des autres tâches sont redirigées vers Opus 4.8. En biologie, seules les organisations validées peuvent demander l’accès au Life Sciences Verification Program. Anthropic prévoit aussi d’étendre son Cyber Verification Program. Enfin, les comptes API créés à partir du 31 août 2026 sont concernés par une fonction de « thinking » préservé, destinée à empêcher l’extraction du raisonnement interne.
Ce que cela change pour les équipes techniques
Les premiers retours mis en avant par Anthropic insistent sur deux effets concrets : moins d’étapes, et des sorties plus lisibles. Des testeurs disent avoir traité une migration de 680 000 lignes en moins d’une journée, tandis qu’un autre a audité et réparé une base de 200 000 lignes en moins de trois heures. Dans les commentaires rapportés par The New Stack, certains observateurs voient dans Opus 5.5 un changement de rôle pour le développeur : moins de production de code, davantage de vérification. C’est une nuance de taille. Un modèle peut finir un ticket, mais il ne sait pas toujours dire si ce ticket valait la peine d’exister.
Anthropic relève aussi les limites de son propre positionnement : l’entreprise ne vend pas ici une IA « magique », mais un outil plus adapté aux enchaînements complets de travail. Pour les équipes, l’enjeu devient donc l’infrastructure, la gouvernance et la surveillance des appels. Le modèle est disponible via la Claude Platform, AWS, Google Cloud et Microsoft Azure, avec maintien du zero data retention comme sur les versions Opus précédentes. Les usages les plus lourds devraient aussi profiter d’une augmentation des limites de cinq heures sur les formules Pro, Max, Team et Enterprise par siège, avec un reset de quota réutilisable plus tard.
En chiffres
- 40 % — baisse annoncée du coût sur charges typiques, selon Anthropic.
- 4 dollars / 20 dollars — prix par million de jetons, entrée et sortie.
- 60 % — baisse du prix des lectures de cache sur l’API.
- 2 000 — scénarios couverts par l’audit comportemental automatisé.
- 31 août 2026 — date d’application du contrôle de pensée préservé pour certains comptes API.