Rho-1, le modèle de Reka AI qui mêle texte, vidéo et robotique
Reka AI a présenté Rho-1, un modèle multimodal de 19 milliards de paramètres capable de traiter texte, images, vidéo et actions robotiques dans un seul réseau. Le prototype s’inscrit dans la course aux “world models”, ces systèmes qui veulent relier perception et action.
Reka AI a publié le 5 octobre 2026 une version de recherche de Rho-1, un modèle multimodal de 19 milliards de paramètres qui traite texte, images, vidéo et commandes robotiques dans un seul réseau neuronal. L’intérêt dépasse la démonstration technique : le système évite de répartir les tâches entre plusieurs modèles spécialisés et peut continuer à générer de la vidéo en temps réel tout en recevant de nouvelles consignes. Autrement dit, il vise une IA qui ne change pas de moteur à chaque virage.
Un modèle unique pour plusieurs médias
Rho-1 fonctionne avec un contexte partagé unique, sans appels d’outils ni modèles externes, selon Reka AI. Dans cette architecture, toutes les modalités sont traitées comme des tokens, une unité de représentation utilisée par les modèles de langage pour manipuler du texte, puis étendue ici à l’image, à la vidéo et aux actions de contrôle. Le principe est simple à énoncer, moins à faire tenir à l’échelle industrielle.
La promesse est surtout de réduire la fragmentation des chaînes d’IA. Là où beaucoup de systèmes passent d’un modèle à l’autre pour comprendre une image, décrire une scène puis produire une action, Rho-1 concentre ces étapes dans le même réseau. Cela peut compter pour les usages embarqués, la robotique ou les applications qui exigent une réponse rapide à des instructions nouvelles.
La robotique, test utile pour la théorie
Reka AI indique avoir entraîné le modèle à partir de signaux de contrôle extraits de vidéos Internet, via un modèle de dynamique inverse chargé d’inférer les commandes de mouvement. Cette méthode sert à contourner la rareté des données robotisées, toujours coûteuses à collecter. Le résultat revendiqué est un modèle dont les mêmes poids servent à prédire des images de caméra et à piloter des mouvements de robot.
Le point est stratégique, car la robotique reste l’un des terrains les plus exigeants pour les modèles fondés sur le monde réel. Si Rho-1 tient ses promesses, il pourrait renforcer l’idée qu’un même système peut apprendre à percevoir et à agir sans tout reconstruire à partir de briques séparées.
Une pièce de plus dans la course aux world models
Le lancement s’inscrit dans un mouvement plus large de la recherche en IA vers les world models, des modèles qui cherchent à représenter un environnement et à anticiper ses évolutions. Reka AI n’arrive pas de nulle part : en avril 2024, l’entreprise avait déjà lancé Reka Core, un modèle multimodal présenté comme concurrent de GPT-4, Claude 3 et Gemini Ultra sur des benchmarks.
Cette continuité compte pour le marché, car elle montre que les modèles multimodaux ne se limitent plus à comprendre une image ou une vidéo. Ils essaient désormais de relier perception, génération et action dans la même architecture. Si cette voie se confirme, la frontière entre assistant, système de vision et agent robotique pourrait devenir plus floue qu’on ne l’imaginait. Et pour les équipes produit, cela veut dire moins de tuyauterie à entretenir, donc moins de sueur froide le vendredi soir.
Points clés
- Rho-1 a été présenté le 5 octobre 2026.
- Le modèle compte 19 milliards de paramètres.
- Reka AI dit l’avoir entraîné sur 320 H100.
- L’entraînement a duré environ trois mois.
- Rho-1 vise texte, images, vidéo et robotique dans un seul réseau.
- Reka Core avait été lancé en avril 2024.
En chiffres
- 19 milliards de paramètres — taille de Rho-1, selon Reka AI, octobre 2026.
- 320 GPU H100 — ressources d’entraînement revendiquées par Reka AI.
- Environ 3 mois — durée d’entraînement annoncée pour le modèle.
- Avril 2024 — date de lancement de Reka Core par Reka AI.