Cloudflare Clef veut automatiser les décisions des agents IA

Cloudflare lance Clef et Clef-flash, deux modèles de décision pour agents IA. L’entreprise promet des réponses plus rapides que les concurrents et prépare aussi un service de fine-tuning.

Cloudflare a dévoilé Clef et Clef-flash, deux modèles de décision pensés pour les agents IA et les systèmes de support automatisé. Leur principe est simple : plutôt que rédiger du texte, ils attribuent des probabilités à des réponses prédéfinies afin qu’un logiciel puisse agir tout seul. L’enjeu est concret pour les entreprises, car la classification d’une demande, d’un site ou d’un signal de fraude peut désormais se faire sans attendre une validation humaine à chaque étape.

Des modèles qui classent plutôt qu’ils ne bavardent

Un modèle de décision n’essaie pas de répondre comme un chatbot classique. Il évalue un contexte, compare plusieurs options et renvoie des probabilités, ce qui permet ensuite de router un ticket, déclencher une escalade ou laisser un humain reprendre la main si nécessaire. Cloudflare présente Clef comme une réponse directe à Jev, le modèle de TypeSafe AI, avec une compatibilité API annoncée pour faciliter le changement d’un système à l’autre.

Dans son propre discours, l’entreprise va loin : « a human does not necessarily need to be in the loop for agentic decisions anymore. » La formule dit bien l’intention. Ces modèles visent le milieu de terrain entre les grands modèles de langage, capables de raisonner mais parfois lents, et les classifieurs traditionnels, rapides mais moins souples dès qu’une nouvelle catégorie apparaît.

La vitesse devient l’argument central

Cloudflare met surtout en avant la latence. Selon ses chiffres, Clef-flash affiche une médiane de 39 millisecondes et Clef de 209 millisecondes, contre un peu plus de 524 millisecondes pour Jev. L’entreprise ajoute que ses résultats viennent de 43 benchmarks et qu’ils s’appuient sur son infrastructure, avec un traitement au plus près des centres de données de périphérie.

Le modèle compact Clef-flash vise donc les usages où chaque milliseconde compte. C’est le cas, par exemple, du tri de tickets, du filtrage de contenus ou de la détection de comportements suspects. Dans un test cité par Cloudflare, un domaine reçoit 95 % de probabilité d’être un site de mode, 85 % d’être une boutique en ligne et moins de 1 % d’être un site de phishing. Le tout en 2,2 secondes pour l’extraction, le rendu et la classification. Pas besoin d’un café pendant ce temps-là.

Une base Qwen, du texte et des images

Techniquement, Clef repose sur Qwen3.8-27B et Clef-flash sur Qwen3.5-9B. Cloudflare précise ne pas modifier les modèles de base pendant l’entraînement, mais ajouter des composants entraînés sur ses propres données synthétiques pour produire les options de réponse et leurs probabilités. Les deux modèles supportent le texte et les images, et Clef dispose d’une fenêtre de contexte de 64 000 tokens, soit deux fois celle de Jev selon Cloudflare.

L’entreprise affirme aussi que Clef domine le Jev Decision Index dans ses propres tests. Dans le détail, les résultats publiés donnent 91,93 pour Clef sur API Bank, 72,37 sur When2Call et 79,60 sur PhishNChips. Clef-flash atteint 93,11 sur API Bank, 65,58 sur When2Call et 75,05 sur PhishNChips. En face, Jev affiche 88,19, 80,97 et 62,55 sur ces mêmes jeux de test. Les comparaisons restent à prendre comme des chiffres maison [à vérifier], mais elles montrent le positionnement de Cloudflare sur la performance pure.

Une offre pensée pour les clients, et pour Cloudflare lui-même

Autour du lancement, Cloudflare déploie aussi un service de reinforcement learning pour adapter Clef à des usages métier. Des ingénieurs accompagneront d’abord les clients sur les phases de fine-tuning, avant l’arrivée annoncée d’une plateforme en libre-service. Le schéma prévu passe par AI Gateway pour journaliser les requêtes, par des conteneurs servant de bac à sable RL, puis par Workers AI pour remettre le modèle personnalisé en production. La société précise également utiliser la technologie de Replicate, rachetée fin 2025, pour exécuter des modèles personnalisés.

Cloudflare dit vouloir utiliser Clef en interne pour examiner les signalements d’abus, trier les demandes de support et distinguer les bots utiles des bots malveillants. Les deux modèles sont disponibles sur Workers AI et publiés sur Hugging Face sous licence Apache-2.0. Ils s’inscrivent dans une montée en puissance prudente mais nette de Cloudflare sur l’IA, après ses outils de contrôle des bots lancés en juillet.

Points clés

  • Clef et Clef-flash ciblent les décisions automatisées des agents IA.
  • Cloudflare annonce 39 ms pour Clef-flash, 209 ms pour Clef.
  • Jev sert de concurrent direct chez TypeSafe AI.
  • Les modèles reposent sur Qwen3.8-27B et Qwen3.5-9B.
  • Cloudflare veut aussi proposer du fine-tuning aux clients.
  • Les modèles sont disponibles sur Hugging Face sous Apache-2.0.

En chiffres

  • 39 millisecondes — latence médiane annoncée pour Clef-flash, Cloudflare, 2026.
  • 209 millisecondes — latence médiane annoncée pour Clef, Cloudflare, 2026.
  • 524 millisecondes — latence médiane annoncée pour Jev, Cloudflare, 2026.
  • 64 000 tokens — fenêtre de contexte de Clef, Cloudflare, 2026.
  • 43 benchmarks — base de comparaison citée par Cloudflare, 2026.

À lire