Cloudflare met des modèles de décision ouverts face à Jev
Cloudflare présente Clef et Clef-flash, deux modèles de décision open-weight compatibles avec l’API de Jev. Ils gèrent texte, images et vidéo, avec exécution locale ou via Workers AI.
Cloudflare a présenté Clef et Clef-flash, deux modèles de décision ouverts conçus pour répondre à des questions fermées de type oui/non, choix multiple ou classement. L’enjeu est simple : proposer une alternative compatible avec Jev, le modèle de TypeSafe AI, tout en ajoutant l’image et la vidéo à l’équation. Les deux modèles sont déjà disponibles sur Workers AI et sur Hugging Face, ce qui les rend exploitables en local pour les équipes qui ont la puissance matérielle suffisante.
Des modèles qui tranchent, sans bavarder
Clef n’est pas un chatbot et Cloudflare le dit clairement. Un modèle de décision prend un état d’entrée, lit un schéma de questions typées, puis renvoie une probabilité pour chaque réponse autorisée. Pas de texte libre, pas de sortie à interpréter au petit bonheur la chance ; l’intérêt est de fiabiliser des tâches de classement ou d’arbitrage dans des workflows techniques. Dans ce contexte, Cloudflare positionne Clef comme une brique d’inférence plus structurée que les LLM classiques.
La famille comprend deux versions. Clef repose sur Qwen3.8-27B, tandis que Clef-flash s’appuie sur Qwen3.5-9B. Les deux conservent l’encodeur vision du backbone, ce qui leur permet de traiter des images. D’après Cloudflare, la logique d’inférence se déroule en deux temps : un premier passage de préremplissage, puis une tête de schéma qui attribue des scores aux options. Le vocabulaire est technique, mais l’idée est assez terre à terre : faire voter le modèle sur des réponses fermées plutôt que lui laisser écrire une dissertation.
Ce que Cloudflare revendique face à Jev
Sur ses propres tests, Cloudflare affirme que Clef progresse nettement sur plusieurs benchmarks de l’index Decision Index 0.2.1. L’entreprise dit notamment obtenir 94,20 sur BANKING77 contre 79,74 pour Jev, et 97,43 sur CLINC150+OOS contre 89,27. Sur d’autres tests plus académiques, Jev garde l’avantage, avec 78,3 sur GPQA Diamond contre 48,0 pour Clef, 82,7 sur MMLU-Pro contre 65,9, et 92,9 sur BBH contre 73,7. Les chiffres sont fournis par le vendeur et n’ont pas encore été reproduits indépendamment [à vérifier].
Autre différence importante : Clef accepte jusqu’à 64 questions par requête et jusqu’à 4 images sur Workers AI, avec une fenêtre de contexte de 64k tokens. Cloudflare met aussi en avant des latences médianes de 209,3 ms pour Clef et 38,8 ms pour Clef-flash, contre 524,1 ms pour Jev dans son propre relevé interne. Là encore, on parle de mesures maison, donc prudence. En revanche, la compatibilité avec l’API System One de Jev est bien annoncée : changer de modèle doit se résumer à modifier l’endpoint et le nom du modèle.
Prix, hébergement et matériel : la facture finit toujours par arriver
Cloudflare propose Clef en hébergement via Workers AI, mais aussi en téléchargement sur Hugging Face sous licence Apache 2.0, avec une précision utile : les jeux de données d’entraînement ne sont pas publics. Le service facturé sur Workers AI coûte $0,24 par million de tokens pour Clef et $0,09 pour Clef-flash, contre $0,042/M pour Jev selon les éléments fournis. Pour l’exécution locale, Cloudflare indique que Clef-flash demande au moins 41 Go de VRAM, tandis que Clef en requiert 85 Go sur un GPU, dans l’hypothèse d’une concurrence unique et d’un contexte de 64k tokens.
Cette ouverture a un intérêt concret pour les équipes qui veulent garder la main sur leurs modèles de décision, mais elle ne supprime pas les contraintes. Il faut du matériel, des intégrations, et parfois un peu de patience pour transformer un benchmark vendeur en outil de production. Cloudflare ajoute enfin un service de reinforcement learning pour adapter Clef à des données privées, d’abord avec ses ingénieurs en mission sur site, puis via une offre self-serve. Le message est clair : l’entreprise ne vend pas seulement un modèle, elle pousse aussi une plateforme autour.
En chiffres
- 2 modèles — Clef et Clef-flash, annoncés par Cloudflare le 1er octobre 2026.
- 64 questions — maximum par requête sur Workers AI, avec jusqu’à 4 images.
- 64k tokens — fenêtre de contexte annoncée pour les deux modèles.
- 85 Go de VRAM — mémoire GPU requise pour Clef en local selon Cloudflare.
- $0,24/M tokens — tarif annoncé pour Clef sur Workers AI.