HUMAIN muscle son modèle arabe avec un preview ouvert aux tests

HUMAIN a présenté humain-m3 à LEAP, à Riyad, et l’a ouvert en research preview via HUMAIN Node. Le modèle vise l’arabe à grande échelle, avec plus d’un trillion de tokens et une sortie de poids ouverte prévue ensuite.

HUMAIN, société d’IA soutenue par le Public Investment Fund saoudien, a dévoilé le 3 septembre 2026 humain-m3 à LEAP, à Riyad, puis l’a mis en research preview sur HUMAIN Node. Ce modèle de langage en arabe vise un segment encore peu servi à la frontière de l’IA, avec une ambition claire : mieux traiter une langue parlée par des centaines de millions de personnes, selon le PDG Tareq Amin. L’enjeu dépasse la démonstration technique. Il touche à l’accès aux modèles avancés, aux usages en entreprise et à la place de l’arabe dans les systèmes d’IA les plus puissants.

Un modèle géant, pensé pour l’arabe natif

humain-m3 est présenté comme un modèle mixture-of-experts de 428 milliards de paramètres, bâti sur la lignée MiniMax-M3 et pré-entraîné avec plus d’un trillion de tokens de contenu arabe natif. Une mixture-of-experts, pour rappel, n’active qu’une partie de ses paramètres à chaque requête afin de gagner en efficacité. HUMAIN indique aussi que le modèle active 23 milliards de paramètres par token et qu’il a été conçu dès le départ comme un système multimodal, capable de travailler sur texte, image et vidéo.

La société affirme que cette base lui permet de gérer des workflows d’agents sur longue durée, avec usage d’outils et interaction avec l’ordinateur, en arabe comme en anglais. Trois modes de raisonnement sont proposés : toujours actif, adaptatif et désactivé. Cela peut sembler technique, mais le point clé est plus simple : le modèle ne se contente pas de répondre, il peut enchaîner des tâches et exploiter plusieurs types de données, ce qui le rapproche des usages pro les plus ambitieux.

Des scores élevés, mais des résultats à lire dans le détail

Sur la page HUMAIN Node, le checkpoint de research preview affiche une moyenne de 89,37 % sur sept benchmarks arabes publics, selon l’évaluation publiée par HUMAIN. La comparaison annoncée le place devant GPT-5.6 SOL à 87,30 %, Opus 5 à 87,34 % et le checkpoint de référence MiniMax M3 à 80,34 %. HUMAIN dit aussi mener sur cinq des sept tests évalués. [à vérifier] Ces mesures relèvent toutefois de l’évaluation de l’entreprise, et elles doivent être lues avec la prudence habituelle quand un éditeur compare ses propres résultats à ceux de concurrents.

Dans le détail, le modèle obtient 86,45 % sur AlGhafa pour la compréhension de l’arabe, 90,70 % sur ArabicMMLU pour les connaissances générales, 67,67 % sur Arabic EXAMS, 95,44 % sur MadinahQA, 97,53 % sur AraTrust, 94,63 % sur ALRAGE et 93,20 % sur Translated MMLU. HUMAIN indique aussi que son post-training arabe apporte neuf points de plus en moyenne par rapport au modèle de référence. L’ensemble dessine un message assez net : la bataille ne se joue plus seulement sur l’anglais, mais aussi sur la maîtrise fine des langues locales.

HUMAIN Node sert de vitrine et de rampe de lancement

Le modèle est accessible via HUMAIN Node, la plateforme de l’entreprise qui donne accès à des modèles avancés et à des capacités d’inférence pour développeurs, chercheurs et entreprises. Les utilisateurs peuvent tester humain-m3 dans un playground no-code ou via un endpoint API compatible OpenAI. L’accès est organisé en plusieurs niveaux : ouverture de compte, demande d’accès, puis preview limitée ou research preview complète selon le cas.

Dans la version limitée, HUMAIN applique un garde-fou d’alignement saoudien, coupe le raisonnement et le streaming, et accepte une latence plus élevée. La research preview, elle, donne accès au checkpoint complet, avec raisonnement, streaming et latence réduite. Cette gradation raconte aussi la stratégie de l’entreprise : faire tester tôt, collecter des retours, puis ajuster les checkpoints suivants avant une disponibilité générale. Une manière assez classique de lancer un modèle, mais avec une attention forte portée aux dialectes arabes et à la sécurité.

Vers des poids ouverts, si l’alignement suit

HUMAIN dit attendre une publication des poids sous MiniMax Community License une fois l’entraînement de sécurité et l’alignement terminés, avec un objectif visé pour le mois suivant l’annonce. Les poids d’un modèle sont ses paramètres publiés, ce qui permet à d’autres équipes de le déployer ou de l’étudier plus librement. Si ce calendrier se confirme, le modèle passerait d’une phase de test à une diffusion plus large, ce qui pourrait intéresser les chercheurs autant que les entreprises qui veulent du multilingue robuste sans repartir de zéro.

La société relie ce lancement à deux axes : construire des capacités de pointe pour l’arabe et rendre cette intelligence plus accessible via HUMAIN Node. Elle dit aussi travailler avec plusieurs acteurs de l’IA mondiale, en parallèle de sa famille ALLAM de modèles arabes. Le marché, lui, va regarder deux choses de près : la tenue réelle du modèle hors benchmark, et la vitesse à laquelle HUMAIN transforme une vitrine de prestige en produit utilisable à grande échelle.

Points clés

  • Annonce faite le 3 septembre 2026 à LEAP, à Riyad.
  • humain-m3 compte 428 milliards de paramètres.
  • Plus d’un trillion de tokens arabes natifs ont servi au préentraînement.
  • La preview affiche 89,37 % sur sept benchmarks arabes.
  • HUMAIN vise une sortie des poids le mois suivant.
  • Tareq Amin veut combler le sous-investissement de l’arabe en IA.

En chiffres

  • 428 milliards — paramètres du modèle, annonce HUMAIN, 3 septembre 2026.
  • 1 trillion+ — tokens arabes natifs utilisés au préentraînement, annonce HUMAIN.
  • 89,37 % — moyenne sur sept benchmarks arabes publics, page HUMAIN Node.
  • 23 milliards — paramètres activés par token, description de l’architecture sur Node.
  • 9 points — gain moyen revendiqué par le post-training arabe sur le modèle de référence.

À lire