Kolibri d’Aleph Alpha mise sur l’IA souveraine et bilingue
Aleph Alpha lance Kolibri, un modèle open-weight bilingue anglais-allemand pensé pour les usages souverains. Le système vise les administrations et secteurs régulés, avec exécution sur site et contextes jusqu’à un million de tokens.
Aleph Alpha a présenté Kolibri, un modèle d’IA bilingue anglais-allemand en open-weight destiné aux usages souverains et aux environnements régulés. Le système peut être téléchargé avec ses poids complets sous licence Apache 2.0 et exécuté sur les propres serveurs du client, sans envoyer les données internes vers un service d’inférence tiers. L’enjeu est clair : garder la main sur les données, les coûts et la conformité, surtout quand l’administration ou l’industrie ne veulent pas jouer à la roulette des API.
Un modèle pensé pour les secteurs qui n’aiment pas les surprises
Kolibri vise d’abord les administrations publiques, l’automobile, les semi-conducteurs, les technologies industrielles et l’aéronautique, selon Aleph Alpha. La société dit avoir conçu des suites d’évaluation sectorielles sans utiliser les données des clients, avec un accent sur le raisonnement, le code, les tâches agentiques et le travail sur longs contextes. Dans ce cadre, le modèle doit aussi savoir s’abstenir de répondre quand la preuve manque, une approche que l’entreprise relie à sa procédure Merlin-Arthur de grounding.
Sur le papier, Kolibri combine 78,1 milliards de paramètres au total et 3,46 milliards activés par token. L’architecture repose sur 384 experts, dont six activés à chaque token, avec attention complète sur 10 des 50 couches et une fenêtre glissante de 512 tokens sur les 40 autres pour contenir les coûts d’inférence. Aleph Alpha annonce également une prise en charge de contextes allant jusqu’à 1 048 576 tokens, même si l’adaptation a atteint 256 000 tokens. Là, on n’est plus dans la petite fiche technique ; on est dans le roman-fleuve.
Un long entraînement pour un contrôle plus serré
Le modèle a été entraîné sur 768 GPU B200, d’abord sur 20 000 milliards de tokens pendant 21 jours, puis lors d’une phase de mid-training et d’adaptation long contexte pour atteindre près de 24 000 milliards de tokens au total. Aleph Alpha dit avoir construit le modèle en Allemagne, l’avoir entraîné en Allemagne et en Finlande, et conserver la maîtrise de la curation des données, de l’entraînement, de l’évaluation, des poids et du déploiement pour répondre aux exigences européennes de conformité et de souveraineté.
La partie linguistique a été travaillée pour l’allemand, qui représente 21,3 % des tokens de pré-entraînement, avec un vocabulaire bilingue de 128 000 entrées et un tokenizer conçu pour préserver les mots composés allemands. Kolibri propose quatre réglages de raisonnement — aucun, faible, moyen et élevé — ainsi que l’appel à des outils. Le modèle est aussi présenté comme apte aux tâches de maths, de code et de grounding, c’est-à-dire de réponse appuyée sur des preuves plutôt que sur de la divination algorithmique.
Des résultats maison, à lire avec la prudence habituelle
Dans ses propres benchmarks, Aleph Alpha indique un score global de 75,5 en anglais et de 70,8 en allemand. Kolibri affiche aussi 96,9 sur AIME 2025, 85,9 sur LiveCodeBench v6 et 61,4 sur BFCL v4 au total, des résultats fournis par l’éditeur lui-même avec ses bancs d’essai et, quand c’est pertinent, le niveau de raisonnement le plus élevé. Ces chiffres suggèrent une volonté de se placer sur le compromis entre qualité et coût de service, avec une comparaison revendiquée à des modèles jusqu’à quatre fois plus gros en paramètres actifs sur certaines tâches.
Le volet grounding est central dans cette version. Sur AA-Omniscience, Kolibri a évité une mauvaise réponse dans 44 % des cas, contre 14,8 % pour Kolibri Origin, et atteint 0,23 sur le score M/A d’Aleph Alpha. La société base cette promesse sur des exemples d’abstention : mieux vaut dire qu’on ne sait pas que d’inventer une réponse polie. Dans un marché de l’IA où beaucoup promettent la confiance, Kolibri mise plutôt sur le droit au silence bien calibré.
Ce que change Kolibri pour Aleph Alpha
Cette sortie confirme la stratégie d’Aleph Alpha : proposer une IA de production qui reste hébergeable en interne, avec une chaîne de contrôle complète sur les données et les poids. Pour les clients publics ou régulés, l’intérêt est double. D’un côté, réduire la dépendance à un fournisseur d’inférence externe. De l’autre, garder une trace plus nette des choix techniques et des responsabilités, un point décisif quand les contraintes juridiques pèsent autant que les performances.
Le modèle est disponible sur Hugging Face, avec déploiement via le package d’inférence d’Aleph Alpha et un plugin vLLM dédié à Kolibri. La portée réelle de cette annonce dépendra maintenant des tests indépendants, des coûts de déploiement et de la facilité d’intégration chez les clients. Sur le papier, en revanche, Kolibri coche plusieurs cases très recherchées : contrôle, bilinguisme, long contexte et exécution locale.
En chiffres
- 78,1 milliards de paramètres — Kolibri, Aleph Alpha.
- 3,46 milliards activés par token — architecture Mixture-of-Experts.
- 1 048 576 tokens — contexte maximal servi par Aleph Alpha.
- 21 jours — pré-entraînement initial sur 20 000 milliards de tokens.
- 21,3 % — part de l’allemand dans les tokens de pré-entraînement.