Kolibri, le modèle open-weight d’Aleph Alpha qui vise la souveraineté européenne
Aleph Alpha publie Kolibri, un modèle de langage bilingue allemand-anglais en open weight. Entraîné en Europe et pensé pour les usages publics et industriels, il affiche un positionnement coût-performance ambitieux.
Aleph Alpha a publié Kolibri, un modèle de langage allemand-anglais de 78 milliards de paramètres dont environ 3 milliards sont actifs à chaque token grâce à une architecture de type mixture-of-experts. L’entreprise allemande le présente comme un modèle open-weight pensé pour la souveraineté européenne, avec des poids disponibles sous licence Apache 2.0 sur Hugging Face. Le sujet compte car il touche à la fois la compétitivité des modèles, la dépendance technologique et les usages sensibles de l’administration ou de l’industrie. Et, dans ce domaine, les détails de licence finissent souvent par compter autant que la taille du modèle.
Un modèle bilingue taillé pour l’Europe
Kolibri a été entraîné avec 21,3 % de données en allemand, via un pipeline dédié construit par Aleph Alpha pour ce projet. L’entreprise indique aussi avoir utilisé des modèles chinois pour générer des données synthétiques d’entraînement. Selon sa communication, le modèle a été développé sous le droit européen et en tenant compte de l’EU AI Act, le règlement européen sur l’intelligence artificielle.
Cette orientation n’est pas qu’un habillage marketing. Aleph Alpha cible clairement des usages où la maîtrise du cadre juridique, des données et de l’infrastructure pèse lourd : administration publique, aviation et industrie. À ce stade, Kolibri ressemble moins à un chatbot grand public qu’à une brique de base destinée à des déploiements contrôlés.
Des performances revendiquées sur le coût et la vitesse
Aleph Alpha affirme que Kolibri se situe sur la « Pareto front » de la qualité et du coût d’exploitation en allemand comme en anglais. En pratique, la formule signifie que le modèle prétend offrir un meilleur compromis que plusieurs modèles comparables, sans perdre trop en qualité pour réduire les coûts d’inférence, ou l’inverse. L’entreprise dit aussi que Kolibri dépasse des modèles à architecture proche, parfois plus anciens, sur l’un ou l’autre de ces critères.
Sur les benchmarks allemands, le modèle atteint 71 % selon la société, tout en décodant plus vite que GPT OSS A5B, Qwen 3.6 A3B et Gemma 4 A4B. Ces comparaisons restent à prendre dans le périmètre du rapport technique d’Aleph Alpha [à vérifier] si l’on veut les remettre en perspective avec des tests indépendants. Mais elles montrent clairement la ligne de force du produit : pas seulement grossir, plutôt mieux équilibrer puissance et facture cloud.
Du calcul européen, et pas qu’un peu
Le modèle a été entraîné sur 768 GPU B200, répartis entre l’Allemagne et la Finlande, selon le rapport technique. Kolibri supporte par ailleurs des fenêtres de contexte allant jusqu’à un million de tokens, ce qui permet d’ingérer des volumes de texte très importants dans une même requête. Pour les cas d’usage documentaires ou juridiques, ce n’est pas un détail.
Le choix de publier les poids en open weight sous licence Apache 2.0 place Aleph Alpha dans une catégorie intermédiaire entre l’open source strict et les modèles fermés. Les entreprises peuvent les télécharger, les adapter et les intégrer, tout en restant dans un cadre d’usage relativement permissif. C’est aussi une manière de peser dans la bataille des infrastructures d’IA en Europe, où le contrôle des briques de base reste un sujet politique autant que technique.
Points clés
- 78 milliards de paramètres pour Kolibri.
- Environ 3 milliards actifs par token via mixture-of-experts.
- 21,3 % de données allemandes dans l’entraînement.
- 768 GPU B200 utilisés en Allemagne et en Finlande.
- 71 % sur des benchmarks allemands, selon Aleph Alpha.
- Licence Apache 2.0 sur Hugging Face.
En chiffres
- 78 milliards — paramètres du modèle Kolibri, selon Aleph Alpha.
- 3 milliards — paramètres activés par token, via mixture-of-experts.
- 21,3 % — part des données d’entraînement en allemand.
- 768 GPU B200 — capacité utilisée pour l’entraînement en Allemagne et en Finlande.
- 1 million de tokens — fenêtre de contexte maximale annoncée.