AWS teste des modèles de décision pour alléger les agents IA

AWS présente Strands Decider 2B, un modèle open source conçu pour prendre des décisions bornées dans des workflows d’agents sans générer de texte. L’objectif: réserver les gros modèles aux tâches qui exigent vraiment du raisonnement.

AWS a dévoilé Strands Decider 2B, un modèle open source pensé pour trancher des décisions bornées au sein de workflows d’agents IA, sans produire de texte. La promesse est simple: laisser à un modèle spécialisé les choix routiniers — routage, sélection d’outil, classification de politique — et garder les grands modèles pour les tâches qui demandent davantage de raisonnement. Selon AWS, cette séparation doit réduire les appels inutiles et la facture en jetons, deux sujets qui pèsent vite dans un système agentique.

Quand l’agent n’a pas besoin de bavarder

Strands Decider 2B appartient à une famille encore émergente de modèles de décision : ils évaluent des options, attribuent des scores et renvoient un niveau de confiance, plutôt que de générer une réponse mot à mot. Pour y parvenir, le modèle part de Qwen3.5-2B-Base, mais enlève la tête de modélisation du langage, puis la remplace par une tête de pointeur d’environ 1 million de paramètres qui compare les options proposées. Résultat: environ 1,9 milliard de paramètres et une décision en un seul passage, sans boucle de décodage token par token. C’est moins spectaculaire qu’un long texte, mais souvent beaucoup plus utile dans une chaîne d’outils.

Cette approche a une limite nette. Le modèle ne sert pas à écrire du code, résumer un document ou soutenir une conversation complexe. En revanche, il peut accélérer les tâches répétitives qui encombrent les architectures d’agents. AWS explique aussi que ces scores de confiance doivent être testés sur les usages réels de chaque équipe, car ils ont été calibrés sur un autre jeu d’exemples de classification courts.

Des gains mesurés, mais encore en laboratoire

Sur 231 tâches publiques de JevBench, Strands Decider 2B a répondu correctement à 167 cas, soit 72,3 %. AWS indique une latence médiane de 115 millisecondes par question sur une Nvidia RTX 3090. Les résultats varient toutefois selon la difficulté: 100 % sur le niveau facile et 50,5 % sur le niveau difficile, selon la découpe interne de Strands. La société rappelle aussi que l’échantillon reste limité et que des écarts de moins d’une dizaine de tâches entre essais doivent être lus prudemment [à vérifier].

Le message est clair: ce n’est pas encore un produit managé AWS prêt à l’emploi, mais un terrain d’essai. Strands Labs, créé en février pour héberger ce type de travaux expérimentaux, sert justement à tester si des modèles spécialisés peuvent prendre en charge les fonctions courantes des agents pendant que les modèles plus lourds se réservent les cas ambigus. AWS n’est pas seul sur cette piste: TypeSafe AI avait déjà présenté Jev en septembre comme un « System One Model », conçu pour transformer des entrées non structurées en décisions probabilistes typées.

Pourquoi cela compte pour les chaînes d’agents

Le débat dépasse le seul modèle. Dans un agent, les coûts et la latence s’accumulent vite dès qu’une décision banale passe inutilement par un grand modèle génératif. Séparer les tâches de routage, de filtrage ou de garde-fou du raisonnement profond peut donc alléger les pipelines, surtout quand ils multiplient les appels. AWS dit avoir observé des premiers usages pour le routage et la sélection d’outil, mais ne publie pas encore de gains chiffrés en production ni de référence client. Pour l’instant, l’enjeu est surtout architectural: savoir quelles décisions méritent un LLM complet, et lesquelles peuvent être tranchées plus vite, presque sans bruit.

Points clés

  • Strands Decider 2B est open source et vise les décisions bornées.
  • 72,3 % de réussite sur 231 tâches publiques JevBench.
  • 115 ms de latence médiane sur Nvidia RTX 3090.
  • Strands Labs a été créé par AWS en février.
  • TypeSafe AI a présenté Jev en septembre.
  • AWS ne cite pas encore d’usage production mesuré.

En chiffres

  • 231 tâches — JevBench public, test Strands Decider 2B.
  • 167 réponses correctes — sur 231, soit 72,3 %, selon AWS.
  • 115 millisecondes — latence médiane par question, sur Nvidia RTX 3090.
  • 1,9 milliard — paramètres du modèle, après retrait de la tête de langage.
  • 1 million — paramètres approximatifs de la tête de pointeur.

À lire