Beam, le modèle open-weight de Reflection pensé pour coder plus vite

Reflection AI a dévoilé Beam, son premier modèle open-weight, un mélange d’experts de 501 milliards de paramètres. L’entreprise promet des performances de haut niveau en code et raisonnement, avec une distribution des poids annoncée plus tard en octobre.

Reflection AI a présenté Beam, son premier modèle open-weight, le 5 octobre 2026. Ce système sparse Mixture-of-Experts compte 501 milliards de paramètres au total, dont 23 milliards activés à l’inférence, et vise le code, le raisonnement et les usages agentiques. L’enjeu est clair : montrer qu’un acteur encore jeune peut jouer dans la cour des grands tout en dépensant moins de calcul. Bref, faire beaucoup avec moins, le rêve de tout labo et de tout directeur infra.

Un modèle pensé pour le code, pas seulement pour la démonstration

Reflection présente Beam comme le premier maillon d’une série, avec une suite déjà en entraînement. L’entreprise dit avoir concentré l’apprentissage sur les tâches de programmation et d’agentic AI, c’est-à-dire des modèles capables d’enchaîner des actions outillées plutôt que de simplement répondre en texte brut.

Sur son banc d’évaluation, Beam affiche 80,1 sur Terminal Bench v2.1, 80,9 sur SWE Bench Verified, 77,2 sur SWE Bench Pro v2-Hard, 97,8 sur AIME 2026, 36,2 sur Humanity’s Last Exam sans outils et 90,5 sur GPQA Diamond. Reflection le dit compétitif avec des modèles ouverts plus lourds comme GLM 5.2, et proche de Qwen 3.8-Max sur les tâches de code et d’agents, tout en reconnaissant que Kimi K3 garde l’avantage en capacité brute.

L’argument central n’est donc pas seulement le score, mais l’efficacité à l’inférence. Reflection affirme que Beam atteint des niveaux comparables à GLM-5.2 sur certains raisonnements avancés en consommant trois à quatre fois moins de calcul d’inférence. La comparaison reste approximative, car elle repose sur des données d’Artificial Analysis et de DataCurve et exclut une partie du coût réel de service. Le message, lui, ne laisse pas de place au doute : la bataille se déplace aussi sur le prix du token.

Une architecture qui cherche le bon compromis entre vitesse et mémoire

Beam repose sur une architecture mêlant attention locale et globale, experts routés, équilibrage de charge sans perte auxiliaire et accumulation FP32 des résidus. Dit autrement, le modèle répartit mieux ses calculs pour garder de la tenue sur des séquences longues sans exploser les coûts. Reflection dit aussi avoir ajouté une pénalité de longueur contrôlable, qui récompense les bonnes réponses tout en freinant les bavardages inutiles.

Un paramètre d’effort de raisonnement, exposé à l’utilisateur, permet de choisir entre réponses plus courtes et délibérations plus longues. Dans ce contexte, Beam n’essaie pas de parler pour parler. Il ajuste son comportement selon la tâche, ce qui compte beaucoup pour les usages de code, d’analyse ou d’automatisation.

L’entreprise affirme que certaines capacités ont émergé au-delà du mélange de données initial. Pendant l’apprentissage par renforcement, les performances de navigation ont progressé alors qu’aucune tâche de navigation n’avait été intégrée au départ. Avec accès au web, le modèle a même appris de lui-même à interroger d’autres grands modèles de langage et à utiliser des API OCR pour lire des documents.

Des démonstrations très orientées produit

Reflection met en avant plusieurs cas d’usage pour illustrer Beam : une carte du métro new-yorkais mise à jour en temps réel à partir de données publiques de la MTA, un jeu 3D d’astronaute en p5.js, et un puzzle terre/eau sur une grille mondiale de 16 200 points. Sur ce dernier test, Beam a obtenu 95,5 % de couverture, entre Opus 5 à 92,5 % et Fable 5 à 97,8 % [à vérifier].

Un autre exemple montre Beam produisant un notebook de fine-tuning pour le plus petit modèle Gemma-4 sur une tâche Text2SQL. Reflection dit que cela a augmenté la précision du test tenu à l’écart de 66,5 %. Là encore, l’intérêt est moins le gadget que la logique : le modèle ne sert pas uniquement à répondre, il sert aussi à fabriquer des outils pour améliorer d’autres modèles.

Des moyens industriels qui donnent le ton

Pour préentraîner Beam, Reflection dit avoir utilisé 23,8 trillions de tokens issus du web, de sources publiques et de jeux de données sous licence. L’entraînement complet aurait duré moins de quatre semaines sur 6 144 GPU NVIDIA GB300 NVL72, avec neuf retours en arrière semi-automatiques liés à des pics de gradient ou à des soupçons de corruption silencieuse des données. Le bon rendement, ou goodput, aurait atteint 92,3 %.

La société dit aussi avoir éliminé environ 95 % des jetons bruts d’internet via parsing, déduplication et curation, tout en conservant près de 1,8 trillion de jetons jugés de haute qualité que des filtres classiques auraient laissés de côté. Un pipeline distinct a traité des PDF avec un modèle OCR vision-langage et des classificateurs maison, tandis qu’une phase de midtraining a porté la longueur effective de contexte à un million de tokens.

Une sortie sous contrôle, avant un vrai test du marché

Beam est encore en phase finale de red-teaming et d’évaluation, avec un accès anticipé via une liste d’attente. Reflection prévoit de publier les poids sous licence Apache 2.0 plus tard en octobre, avec un rapport technique, une model card, de la documentation et la pile complète pour exécuter, évaluer et affiner le modèle.

L’entreprise dit aussi préparer des intégrations avec des bibliothèques et des outils open source, et met en avant des liens avec Dell AI Factory with NVIDIA, le Genesis Mission du département américain de l’Énergie et un projet de cloud IA souverain de 250 mégawatts en Corée du Sud avec Shinsegae. Le point important, pour le marché, sera de voir si Beam tient ses promesses hors communiqué. C’est souvent là que la musique devient moins symphonique.

Points clés

  • Beam compte 501 milliards de paramètres, dont 23 milliards actifs.
  • Préentraînement : 23,8 trillions de tokens en moins de quatre semaines.
  • Récompenses RL : plus de 100 millions de rollouts sur quatre semaines.
  • Reflection annonce une sortie sous Apache 2.0 plus tard en octobre 2026.
  • Beam a été présenté le 5 octobre 2026 par Reflection AI.
  • La société cite Dell AI Factory et NVIDIA comme partenaires.

En chiffres

  • 501 milliards — paramètres totaux de Beam, selon Reflection AI, 2026.
  • 23 milliards — paramètres actifs à l’inférence, selon Reflection AI, 2026.
  • 23,8 trillions — tokens utilisés pour le préentraînement, selon Reflection AI, 2026.
  • 6 144 — GPU NVIDIA GB300 NVL72 mobilisés, selon Reflection AI, 2026.
  • 100 millions+ — rollouts générés en apprentissage par renforcement, selon Reflection AI, 2026.

À lire