Granite 4.2 d’IBM mise sur le raisonnement et les agents
IBM lance Granite 4.2, une famille de modèles ouverts en 3B, 8B et 30B, sous Apache 2.0. Les versions 8B et 30B ajoutent un entraînement agentique pour agir dans des environnements de code, terminal et recherche.
IBM a présenté Granite 4.2, une famille de modèles de langage ouverts en 3B, 8B et 30B paramètres, le tout sous licence Apache 2.0. La série se distingue par un positionnement plus net sur le raisonnement, avec un mode pensée activable, un mode non-pensée et une option low-effort pour les requêtes simples. Dans la pratique, IBM ne vend plus seulement un assistant qui répond : il pousse des modèles capables d’argumenter, puis d’agir dans des environnements outillés. C’est une petite nuance sur le papier, mais une grosse différence en production.
Une famille pensée pour raisonner, pas seulement pour bavarder
Granite 4.2 est construit comme un transformer dense décodeur-only, c’est-à-dire un modèle classique qui génère du texte sans architecture MoE ni hybride. IBM indique un préentraînement depuis zéro sur environ 15 000 milliards de tokens, puis une post-formation en plusieurs étapes de renforcement. Les trois tailles partagent la même logique de base, mais les versions 8B et 30B vont plus loin avec un bloc d’agentic RL, un entraînement par renforcement où le modèle apprend à utiliser des outils réels, comme un terminal ou un moteur de recherche.
Ce choix change l’usage visé. Le 3B reste plus proche d’un modèle léger pour postes modestes ou déploiements sobres, quand le 8B cible des équipes techniques sur une seule GPU moderne et que le 30B vise des capacités d’inférence plus larges. IBM évoque aussi un mode low-effort, destiné à économiser du budget de raisonnement sur les questions faciles. Une idée simple, presque désarmante : pourquoi faire réfléchir longtemps un modèle pour savoir combien font deux et deux ?
L’entraînement agentique, là où se joue une partie du gain
La documentation publiée par IBM insiste sur la chaîne de post-entraînement plutôt que sur la seule taille des modèles. Les auteurs décrivent un pipeline multi-étapes, avec des phases dédiées à la robustesse, aux compétences générales, puis à des tâches d’agent logiciel, de terminal et de recherche. Cette approche vise à apprendre au modèle à enchaîner des actions dans des sandbox réelles, pas seulement à produire de belles réponses en langage naturel.
Le point saillant, c’est que ce bloc agentique ne concerne que les modèles 8B et 30B. Le 3B reçoit un entraînement d’alignement plus classique. D’après le papier arXiv « Agent Lightning v1.0: Towards Harnessed Agentic RL », qui parle de « harnessed agentic RL », le harnais d’exécution participe directement à l’entraînement : le système observe des séquences requête-réponse plutôt qu’un environnement complet côté trainer. IBM reprend une logique voisine avec ses environnements de code et de recherche, ce qui confirme que l’infrastructure d’exécution devient un sujet de premier plan pour les modèles agents.
Des résultats solides, surtout pour le code et le terminal
Sur les benchmarks publiés par IBM, le 30B atteint 57,00 sur SWE-Bench Verified et 29,24 sur Terminal-Bench 2.1. Le 8B affiche 47,67 sur SWE-Bench Verified et 20,56 sur Terminal-Bench 2.1. Les autres scores mis en avant incluent notamment τ³-bench, BFCL v4, AIME25, GPQA, MMLU-Pro et RULER 128K, avec une montée logique du 3B vers le 30B sur la plupart des tests.
IBM dit aussi avoir utilisé environ 7,2 millions d’échantillons pour le supervised fine-tuning, avec une part importante de données agentiques et de données liées au génie logiciel. Les trajectoires ont été générées à partir de plusieurs harnesses, dont OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex et Goose. Les jeux ont ensuite été filtrés et dédupliqués. En clair, les données ne sont pas sorties d’un chapeau, même si le chapeau est probablement très bien entraîné.
Pourquoi cela compte pour les équipes techniques
Le sujet dépasse la seule fiche technique. Avec Granite 4.2, IBM renforce une stratégie qui vise les usages professionnels où la licence, l’exécution locale et le contrôle du comportement comptent autant que le score brut. Les cibles citées par IBM vont du développement logiciel à la recherche documentaire, en passant par l’automatisation DevOps, la transcription et les secteurs régulés comme la finance, la santé, les télécoms ou le secteur public.
La disponibilité sous Apache 2.0 facilite en particulier le téléchargement, l’adaptation et l’usage commercial sans verrou de licence. Dans ce contexte, le vrai enjeu n’est pas seulement de savoir si le modèle “parle bien”, mais s’il peut s’intégrer dans des chaînes d’outils existantes sans casser les contraintes de sécurité, de déploiement ou de conformité. C’est souvent là que les modèles ouverts gagnent ou perdent la partie.
En chiffres
- 3 tailles — Granite 4.2 existe en 3B, 8B et 30B paramètres.
- 15 000 milliards de tokens — préentraînement depuis zéro, selon IBM.
- 7,2 millions d’échantillons — pour le supervised fine-tuning.
- 57,00 — score du 30B sur SWE-Bench Verified, selon IBM.
- 29,24 — score du 30B sur Terminal-Bench 2.1, selon IBM.