DeepSeek V4-Flash passe en bêta publique et baisse la facture des agents
DeepSeek a publié V4-Flash-0731 sur Hugging Face et ouvert en bêta publique l’API officielle V4-Flash. Le modèle garde la même architecture, mais gagne en performances après réentraînement, avec un coût API nettement plus bas.
DeepSeek a mis en ligne DeepSeek-V4-Flash-0731 sur Hugging Face et basculé l’API officielle V4-Flash en bêta publique le 31 juillet 2026. Le modèle remplace le preview sans changer d’architecture ni de taille, mais avec un meilleur niveau après réentraînement. Pour les usages agentiques, le signal est clair : l’accès devient moins cher et plus simple à intégrer.
Un même modèle, mais mieux préparé pour travailler tout seul
Le dépôt Hugging Face présente cette version comme la publication officielle qui succède au preview. DeepSeek précise que les gains viennent du post-training, pas d’une nouvelle conception du modèle. En pratique, V4-Flash reste un MoE de 284 milliards de paramètres, avec 13 milliards activés par token et une fenêtre de contexte d’un million de tokens.
Cette architecture mélange plusieurs briques techniques. Le système repose sur une attention hybride, avec Compressed Sparse Attention et Heavily Compressed Attention, tandis que les connexions résiduelles classiques sont remplacées par des Manifold-Constrained Hyper-Connections, un mécanisme de liaison entre couches. Sur le papier, l’ensemble vise surtout l’efficacité à grande échelle. Sur le terrain, le modèle parle surtout aux équipes qui font tourner des agents et des workflows automatisés. Bref, il aime les gros paniers de tokens.
Le prix de l’agent devient plus supportable
Sur l’API, DeepSeek affiche 0,14 dollar par million de tokens d’entrée sur un cache miss, 0,0028 dollar sur un cache hit et 0,28 dollar par million de tokens de sortie, avec une limite de 2 500 requêtes concurrentes. La société positionne donc V4-Flash bien en dessous de V4-Pro sur la sortie, annoncée à 0,87 dollar par million de tokens. Pour les startups, les développeurs indépendants et les équipes plateforme, cela change le calcul économique des boucles d’agents.
DeepSeek indique aussi que V4-Flash prend désormais en charge nativement le format Responses API et qu’il est adapté à Codex. En revanche, l’API V4-Pro ainsi que les modèles de l’application et du web n’ont pas été mis à jour. Autrement dit, le changement vise d’abord l’infrastructure d’exécution, pas toute la famille produit.
Ce que le self-hosting change vraiment
Le modèle est publié sous licence MIT et sans garde d’accès, ce qui lève un frein important pour un déploiement commercial sur site. Mais l’ouverture n’efface pas la contrainte matérielle. DeepSeek explique que tous les experts restent en mémoire, même si seulement 13 milliards s’activent à chaque token. Son exemple vLLM passe sur un seul nœud 4×GB300, tandis qu’Unsloth évoque 162 Go pour une version 8 bits sans perte et 103 Go pour une version 3 bits, avec environ 110 Go de RAM et de VRAM combinées nécessaires.
Le message est donc assez net : le cloud rend le modèle accessible presque immédiatement, tandis que l’hébergement interne reste réservé à des infrastructures déjà sérieuses. Les grandes entreprises y verront un intérêt de contrôle et de coût ; les plus petites devront surtout arbitrer entre facture API et budget matériel.
Des résultats solides, mais à lire avec prudence
DeepSeek dit que V4-Flash-0731 améliore son prédécesseur sur les tâches agentiques publiées dans la carte du modèle. Le score Terminal Bench 2.1 atteint 82,7, contre 61,8 pour le preview. Sur NL2Repo, le score monte à 54,2 contre 39,4, et sur DeepSWE à 54,4 contre 7,3. D’autres mesures suivent la même tendance, notamment Toolathlon-Verified à 70,3 contre 49,7.
Deux réserves s’imposent toutefois. D’abord, les tests de code agent ont été menés avec un mode minimal de DeepSeek Harness, qui n’a pas été publié. Ensuite, certaines mesures, comme DSBench-FullStack à 68,7 et DSBench-Hard à 59,6, sont des jeux internes. Ces scores restent donc à confirmer par des évaluations indépendantes, d’autant que les résultats d’agents dépendent fortement du harness utilisé.
Une publication qui vise les usages réels, pas seulement la fiche technique
V4-Flash ne cherche pas seulement à bien figurer dans un tableau de benchmarks. Il vise surtout les applications où le modèle doit enchaîner des appels, lire de longs contextes et générer vite. DeepSeek indique d’ailleurs que DSpark, son module de décodage spéculatif, peut être activé avec une simple option vLLM, et que la génération utilisateur gagne entre 60 % et 85 % selon le papier DSpark, à débit global comparable. Pour les équipes produit, c’est souvent là que se joue la vraie différence : pas dans la prouesse théorique, mais dans la vitesse à laquelle un agent finit enfin sa tâche sans faire semblant de réfléchir.
À ce stade, la publication confirme surtout une stratégie devenue familière chez les grands éditeurs de modèles : même architecture, meilleur entraînement, prix d’appel agressif et déploiement plus souple. Cela suffit déjà à faire bouger la concurrence sur les agents, les copilotes techniques et les plateformes d’automatisation.
Points clés
- 31 juillet 2026 : publication de DeepSeek-V4-Flash-0731.
- 284 milliards de paramètres, 13 milliards activés par token.
- API V4-Flash : 0,28 dollar par million de tokens de sortie.
- 2 500 connexions concurrentes annoncées par DeepSeek.
- Hugging Face relaie un dépôt à 304 milliards de paramètres.
- DeepSeek dit avoir gardé la même architecture que le preview.