Liquid AI met des modèles décisionnels multimodaux à portée de l’edge
Liquid AI publie d1-3B et d1-omni-600M, deux modèles décisionnels ouverts pour texte, image et audio. Le premier vise la qualité, le second reste expérimental et plus léger pour les usages embarqués.
Liquid AI a publié le 7 octobre 2026 deux modèles décisionnels ouverts, d1-3B et d1-omni-600M, pensés pour fonctionner au plus près du matériel, jusqu’aux appareils embarqués. Le premier gère le texte et l’image, tandis que le second ajoute l’audio en plus, mais reste présenté comme une version expérimentale. L’enjeu est simple : faire tourner des décisions structurées plus vite, avec moins de calcul, là où la latence compte vraiment.
Des modèles qui décident, sans bavarder
Ces modèles appartiennent à la famille d1 de Liquid AI, bâtie sur ses Liquid Foundation Models. Contrairement à un modèle génératif classique, un modèle décisionnel ne produit pas une suite de tokens : il tranche en une seule passe de calcul, ce qui réduit le temps de réponse et la charge côté appareil.
d1-3B, qui accepte le texte et l’image, est présenté par l’entreprise comme le meilleur modèle décisionnel de moins de 10 milliards de paramètres sur le Decision Index 0.2.1, avec un score de 48,57. Dans le même tableau, il devance des modèles 4B et 9B, ainsi que Decider 35B-A3B, crédité de 47,11. Liquid AI indique aussi que d1-omni-600M, plus compact, prend en charge le texte-image ou le texte-audio.
Le edge, ce terrain où quelques millisecondes comptent
Le positionnement vise clairement l’inférence embarquée, c’est-à-dire l’exécution du modèle sur l’appareil lui-même plutôt que dans le cloud. Sur les puces et GPU testés par Liquid AI avec NVIDIA, d1-3B répond à une question en 16 ms sur Jetson AGX Thor, 26 ms sur Jetson AGX Orin et 50 ms sur Jetson Orin Nano. Sur NVIDIA RTX 4090, il descend à 8 ms, et à 9 ms sur AMD MI325X. Pas vraiment le moment idéal pour aller se faire un café.
Les mesures publiées montrent aussi que plusieurs questions peuvent être traitées dans un même passage, avec un surcoût limité. Sur Jetson AGX Thor, trois questions prennent 20 ms contre 16 ms pour une seule. Sur RTX 4090, Liquid AI annonce 21 ms pour trois questions, contre 8 ms pour une question. L’entreprise indique enfin que d1-3B traite une image de 384 px en moins de 18 ms sur les plateformes GPU testées.
Des résultats solides, mais pas sur tout
Sur sept jeux de données publics couvrant la compréhension de texte, la détection de toxicité, l’intention, la question médicale et l’alignement multilingue, d1-3B affiche une moyenne de 82,9. Liquid AI le place devant Decider 4B, donné à 81,1, et devant Decider 2B, à 77,1. De son côté, d1-omni-600M atteint 78,4, avec un gain net sur Decider 2B malgré un quart des paramètres.
L’entreprise précise toutefois qu’elle ne publie pas de benchmark vision ou audio pour cette version, car la Decision Index v0.3 ne comprend qu’une partition vision privée et que les benchmarks audio restent, selon ses mots, un problème ouvert. Autrement dit, le modèle sait gérer plus de modalités, mais toutes ne sont pas encore évaluées au grand jour.
Ce que Liquid AI met réellement entre les mains des développeurs
Les deux modèles sont disponibles en poids ouverts sur Hugging Face. Liquid AI recommande d’installer transformers en version 5.14 ou plus, puis de charger les modèles avec trust_remote_code=True, car ils embarquent leur propre code. L’exemple fourni montre un usage très concret : classification de tickets, détection d’un remboursement, routage vers une équipe ou évaluation d’urgence, le tout dans une seule passe.
Sur le fond, l’intérêt dépasse la simple démonstration technique. Pour les fabricants d’appareils, les éditeurs d’assistants ou les équipes de support, un modèle plus rapide et plus compact peut réduire la dépendance au cloud, baisser la latence et mieux protéger certaines données locales. Reste une limite classique : ce type de système gagne en efficacité quand la tâche est bien cadrée, mais il ne remplace pas un grand modèle généraliste pour tout faire.
Points clés
- d1-3B et d1-omni-600M ont été publiés le 7 octobre 2026.
- d1-3B score 48,57 sur Decision Index 0.2.1.
- Liquid AI le place devant Decider 35B-A3B à 47,11.
- d1-3B répond en 16 ms sur Jetson AGX Thor.
- d1-omni-600M reste une release de recherche expérimentale.
- Les deux modèles sont disponibles sur Hugging Face.
En chiffres
- 48,57 — score de d1-3B sur Decision Index 0.2.1, selon Liquid AI.
- 16 ms — temps de réponse annoncé sur Jetson AGX Thor, octobre 2026.
- 82,9 — moyenne de d1-3B sur sept jeux de données publics.
- 78,4 — moyenne de d1-omni-600M sur les mêmes tests.
- 7 — jeux de données publics utilisés pour le benchmark.