AstaBrief 8B accélère la synthèse scientifique avec des sources citées

Ai2 ouvre le poids d’AstaBrief 8B, un modèle conçu pour transformer une question de recherche et des extraits de littérature en rapport cité. Dans Asta, Fast mode réduit nettement le temps de génération face au mode Thinking.

Le Allen Institute for AI (Ai2) a ouvert le poids d’AstaBrief 8B le 2 octobre 2026, un modèle qui transforme une question de recherche et des extraits de littérature en rapport sourcé. Dans Asta, sa plateforme agentique pour le travail scientifique, il alimente désormais Fast mode, présenté comme une alternative plus rapide au mode Thinking basé sur Claude. L’enjeu est clair : produire des synthèses vérifiables, plus vite, sans perdre le fil des citations. Et éviter que le modèle ne parte en freestyle académique.

Un mode rapide pensé pour les rapports de recherche

AstaBrief 8B est un modèle open source sous licence Apache 2.0, dérivé de Qwen3-8B, que Ai2 veut utilisable pour la recherche et l’éducation. Le système prend une requête, récupère des extraits de littérature puis rédige un rapport complet avec citations, au lieu d’enchaîner plusieurs étapes de résumé et de regroupement des passages. Ai2 explique que cette simplification vise à réduire le coût de service autant que le délai de réponse.

Dans Asta, Fast mode cohabite avec Thinking mode. Selon Ai2, le temps moyen de génération tombe à 51,1 secondes par rapport contre 178,5 secondes pour Thinking mode sur l’ensemble du pipeline Asta, soit environ 3,5 fois plus rapide. Le gain compte surtout pour les chercheurs qui itèrent sur un même sujet et veulent un premier jet exploitable sans attendre une éternité polie par les GPU.

Pourquoi Ai2 a changé la recette

Le projet ne repose pas sur un entraînement compliqué à l’excès, et c’est volontaire. Ai2 dit avoir écarté une approche par apprentissage par renforcement, jugée plus instable et plus coûteuse, pour privilégier un duo plus simple : supervised fine-tuning puis direct preference optimization, ou DPO. Le supervised fine-tuning consiste à apprendre à partir d’exemples de bonnes réponses ; le DPO ajuste ensuite le modèle à partir de paires de réponses préférées.

Pour gagner en vitesse, AstaBrief a aussi été entraîné à écrire le rapport final en une seule passe, à partir de la requête et des extraits récupérés. Le pipeline Claude de Thinking mode continue, lui, à passer par des étapes intermédiaires plus lourdes. Ai2 dit avoir pu supprimer ces paliers sans dégrader les performances observées sur ses tests internes.

Des données de qualité, pas juste beaucoup de texte

La matière première du modèle vient de vraies requêtes d’utilisateurs passées par ScholarQA, le système qui sous-tend Asta. Ai2 a filtré ces logs pour retirer le trafic des bêta-testeurs et des robots, écarter les requêtes trop courtes, et détecter les demandes hors sujet, les contenus non anglophones et les données personnelles. Résultat : 90 000 requêtes jugées orientées recherche.

Après génération et filtrage, le jeu de données de supervised fine-tuning a retenu 47 000 exemples utilisables. Pour le DPO, Ai2 a construit environ 6 000 paires de rapports, départagées par deux juges modèles, GPT-4.1 et DeepSeek-R1, qui se sont accordés avec les préférences humaines dans 95 % des cas. Les paires où les deux juges n’étaient pas d’accord ont été écartées.

Des métriques taillées pour la fidélité scientifique

Ai2 a évalué AstaBrief sur SQABench-CS2, un jeu de 200 questions de recherche en informatique rédigées par des utilisateurs, puis sur DeepScholarBench, un benchmark de 63 requêtes fondé sur de récents articles arXiv. Quatre métriques ont servi de fil rouge : la couverture du contenu utile, la pertinence de chaque paragraphe, la précision des citations et le rappel des citations. Autrement dit, pas seulement “est-ce que ça a l’air bien écrit ?”, mais “est-ce que ça prouve quelque chose ?”.

Sur le test SQABench-CS2, le modèle affiche une moyenne de 87, contre 83,7 pour le checkpoint SFT et 77,3 pour Qwen3-8B de base. Le modèle card donne aussi 90,2 en ingredient recall, 89 en answer precision, 90,5 en citation precision et 78,2 en citation recall. Face au pipeline ScholarQA d’Asta, les taux de victoire jugés par un LLM montent à 55 % sur le split de développement et 72 % sur le test.

Dans une étude humaine séparée menée auprès de trois chercheurs, DR Tulu a remporté la préférence générale, mais deux des trois participants ont trouvé AstaBrief meilleur sur la précision des citations. Ai2 mesure aussi DeepScholarBench à 53,50 pour AstaBrief-8B, contre 60,25 pour Asta ScholarQA et 56,26 pour DR-Tulu-8B.

Ce que disent les premiers usages

Les premiers signaux côté Asta restent prudents, mais encourageants. Parmi 374 utilisateurs ayant essayé Fast mode, 29,1 % l’ont utilisé au moins deux jours, avec 3,67 threads de rapport en moyenne. Par ailleurs, 23 % ne sont jamais revenus à Thinking mode pour leurs fils suivants, tandis que 18 % alternent entre les deux selon le besoin, Fast mode pesant alors environ 40 % de leurs threads.

Le taux de retours positifs est très proche entre les deux modes : 84,2 % pour Fast mode, contre 85,2 % pour Thinking mode. Ai2 souligne toutefois que le volume de retours reste trop faible pour tirer des conclusions fermes. En clair, le modèle plaît suffisamment pour continuer, mais pas encore assez pour clamer victoire à grands renforts de slides.

La suite : plus d’outils, plus de contrôle

Ai2 dit explorer davantage de préférence fine, des approches RAG plus RL, des capacités multi-tours et multi-outils, de nouvelles sources scientifiques et la décomposition des requêtes. L’équipe veut aussi tester si un modèle respecte bien le périmètre des preuves citées, au lieu d’élargir trop vite la portée d’une étude. C’est un point central pour les usages de recherche, où une conclusion trop large peut être plus problématique qu’une réponse incomplète.

Le projet s’inscrit dans NSF OMAI, une initiative américaine pilotée par Ai2 pour bâtir une infrastructure et des modèles d’IA ouverts pour la découverte scientifique. AstaBrief apparaît ainsi comme une brique de plus dans une stratégie plus large, de ScholarQA à DR Tulu, avec l’idée de faire de la synthèse scientifique un travail localisable, vérifiable et déployable derrière un pare-feu d’institution.

Points clés

  • Fast mode : 51,1 secondes contre 178,5 secondes.
  • 90 000 requêtes filtrées, puis 47 000 exemples SFT.
  • Le DPO final repose sur environ 6 000 paires.
  • GPT-4.1 et DeepSeek-R1 ont servi de juges.
  • Ai2 publie AstaBrief 8B sous Apache 2.0.
  • Publication annoncée le 2 octobre 2026 par Ai2.

En chiffres

  • 3,5 fois — Fast mode plus rapide que Thinking mode, selon Ai2.
  • 95 % — accord juges / préférences humaines sur le DPO, selon Ai2.
  • 72 % — victoire LLM-judged d’AstaBrief sur le test SQABench-CS2.
  • 374 utilisateurs — premiers testeurs de Fast mode dans Asta.
  • 84,2 % — retours positifs pour Fast mode, selon Ai2.

À lire