Fireworks Nexus et Model Council veulent dompter le coût des agents IA

Fireworks AI et Perplexity misent sur l’orchestration de plusieurs modèles pour réduire les coûts et mieux gérer les tâches complexes. Les deux approches ciblent les équipes qui veulent garder des outils existants sans payer systématiquement le prix fort des modèles frontaliers.

Deux annonces, deux paris sur le même problème : comment faire travailler des agents IA sans laisser la facture filer. Fireworks AI a lancé Fireworks Nexus, une couche de gestion et de routage pour équipes d’ingénierie, tandis que Perplexity a étendu son Model Council à Computer, son interface d’orchestration cloud. Dans les deux cas, l’idée consiste à faire coopérer plusieurs modèles selon la difficulté de la tâche, afin de réserver les modèles les plus chers aux cas qui le méritent. Le sujet compte pour les entreprises car les usages agentiques montent vite, mais les budgets, eux, n’ont pas la politesse de suivre.

Faire passer la bonne requête au bon modèle

Fireworks Nexus, présenté par Fireworks AI, repose sur une logique simple : les tâches courantes vont vers des modèles open-weight moins coûteux, tandis que les tâches difficiles peuvent être renvoyées vers un fournisseur existant sur la clé du client. La plateforme combine des contrôles d’entreprise, une continuité de workflow via FireConnect et un routeur qui évalue la difficulté de chaque requête. Fireworks avance que ce schéma permet généralement une réduction de coût de 3 à 5 fois, tout en laissant les outils comme Claude Code, Codex et OpenCode fonctionner sans changement majeur.

Perplexity adopte une philosophie proche avec son Model Council. L’utilisateur choisit de deux à huit modèles, qui répondent en parallèle à une même question, puis un modèle « chair » synthétise les écarts et les points d’accord. La promesse vise surtout les questions ambiguës, celles où il faut arbitrer entre risques, hypothèses et compromis. La société dit aussi pouvoir transformer cette synthèse en livrables prêts à l’emploi, comme des rapports ou des présentations. On n’a pas trouvé plus discret pour appeler ça un comité d’experts virtuel.

Ce que montrent les premiers chiffres

Les deux sociétés s’appuient sur des tests internes ou partenaires pour défendre l’intérêt du routage. Fireworks cite d’abord un retour préliminaire avec des équipes comme Notion et Doximity : le coût par pull request fusionnée baisserait d’un tiers, avec un taux de jetons mixés annoncé à environ un quart de celui des grands laboratoires fermés. Des évaluations indépendantes viennent ensuite nuancer et renforcer le tableau.

Faros AI a passé 211 tâches d’ingénierie réelles au crible, issues de 12 dépôts et réparties sur sept routes modèle-harness. Son verdict : Claude Code sur GLM-5.2 obtient 0,568, contre 0,521 pour Claude Code sur Opus 4.8 ; le coût par tâche passe de 1,76 dollar à 0,92 dollar. De son côté, Arize a étudié 10 modèles sur 40 tâches Terminal-Bench, avec six essais par tâche, soit 2 400 exécutions et 626 dollars de dépense API. Dans ce jeu, une escalade pensée à l’avance atteint 0,525 dollar par tâche réussie, contre 0,636 dollar pour GPT-5.5 seul et 1,319 dollar pour une montée naïve à travers dix modèles.

Pourquoi l’orchestration devient un sujet produit

Ces résultats racontent moins une guerre de modèles qu’un changement de méthode. Le vrai sujet n’est plus seulement de savoir quel LLM est « le meilleur », mais quand l’utiliser, combien de temps l’interroger et à quel prix. Fireworks le formule comme un problème de correspondance entre tâches routinières et tarifs frontaliers ; Perplexity, comme une façon d’exploiter plusieurs perspectives quand la réponse unique n’existe pas vraiment.

Pour les équipes techniques, l’enjeu est concret. FireConnect promet une installation en une ligne, une compatibilité Anthropic et OpenAI via URL de base et identifiant de modèle, et des commandes dédiées pour activer ou couper le pont. Perplexity, de son côté, rend son Model Council accessible à davantage d’offres, mais facture Computer au crédit, avec 100 crédits équivalant à 1 dollar et des tâches légères ou lourdes consommant très vite le budget. Le routage intelligent séduit donc surtout là où les volumes sont élevés et les cas d’usage variés. Le reste du temps, un seul bon modèle suffit souvent. Le comité, lui, peut attendre.

En chiffres

  • 3 à 5 fois — réduction de coût annoncée par Fireworks AI.
  • 211 tâches — testées par Faros AI sur 12 dépôts.
  • 2 400 exécutions — réalisées par Arize sur 40 tâches.
  • 100 crédits = 1 dollar — tarification de Computer chez Perplexity.
  • 2 à 8 modèles — configuration possible du Model Council dans Computer.

À lire