DeepSeek V4-Flash officiel (août 2026) : benchmarks, prix et compétition des modèles chinois ouverts

Le 31 juillet 2026, DeepSeek promeut V4-Flash-0731 en version API officielle — même architecture 284B/13B qu'en avril, avec des gains uniquement issus du post-entraînement. Les scores agent dépassent la preview V4-Pro ; le prix reste une fraction de Claude Opus 4.8. Le flagship V4-Pro et le framework Harness restent non publiés.

Synthèse : Après le guide V4 GA et la migration API du 24 juillet, le build 0731 apporte une variante plus mature — pas un nouveau modèle. Ce guide couvre chronologie, grille tarifaire, contexte Harness, matrice face à Kimi K3 et Qwen3.8-Max, controverses, « kill line », runbook en six étapes et FAQ, avec recommandation NUKCLOUD pour une CI agent stable.

00Pourquoi V4-Flash-0731 compte maintenant

V4-Flash-0731 n'est pas une refonte paramétrique : c'est le même MoE 284B / 13B actifs qu'en avril, avec un post-entraînement refait. DeepSeek affirme que les benchmarks agent dépassent la preview V4-Pro 1,6T — remettant en cause l'équation « plus gros = meilleur ».

  • Pression prix : output 0,28 $/M contre 25 $/M pour Opus 4.8 — jusqu'à 89× moins cher selon la presse chinoise ; input cache-hit 0,0028 $/M.
  • Dépendance Harness : Terminal Bench 2.0 82,7 vs preview V4-Pro 67,9 — mesuré avec un framework agent non public.
  • Concurrence ouverte : Kimi K3 (27 juillet), Qwen3.8-Max (3 août) et GLM-5.2 poussent DeepSeek dans la logique « kill line ».
  • Pro en attente : V4-Pro officiel et Harness toujours « bientôt » — fenêtre GA 10–20 août non confirmée.
  • Friction terrain : retours développeurs sur faible taux de cache-hit et timeouts du classificateur de sécurité.

01Chronologie : de l'aperçu d'avril à août 2026

DateÉvénement
2026-04-24Preview V4 + poids ouverts (MIT) : V4-Pro 1,6T/49B, V4-Flash 284B/13B, contexte 1M
2026-07-20GA V4 avec tarification peak-valley — voir article GA
2026-07-24Retrait de deepseek-chat / deepseek-reasoner ; trafic vers la famille V4
2026-07-27Moonshot publie les poids Kimi K3 sur Hugging Face (2,8T)
2026-07-31V4-Flash-0731 beta API officielle ; poids MIT ; première mention « Harness » ; API seule, pas d'app/web
2026-08-05V4-Pro officiel et Harness sans date confirmée (date de publication)

02Architecture inchangée — le post-entraînement fait la différence

Le rapport technique DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence conserve trois piliers de l'aperçu :

  • CSA + HCA : attention hybride réduisant FLOPs et KV cache à 1M tokens.
  • mHC : hyper-connexions contraintes stabilisant les résidus profonds.
  • Optimiseur Muon : convergence accélérée.
Trois chiffres clés (éditeur) : à 1M de contexte, V4-Pro n'utilise que 27 % des FLOPs et 10 % du KV cache de V3.2. Intelligence Index Artificial Analysis pour V4-Flash-0731 : 50 à 0,03 $ par tâche — Kimi K3 : 57 / 0,86 $ ; GPT-5.6 Sol et Claude Fable 5 : 9+ points au-dessus, mais 1,86 $ et 3,15 $ par tâche.
ModèleStatutParamètresInput (miss/hit)OutputLicence
V4-Flash-0731Officiel (31/07)284B / 13B0,14 $ / 0,0028 $0,28 $MIT
V4-ProPreview seulement1,6T / 49B0,435 $ / 0,003625 $0,87 $MIT
Kimi K3Poids 27/072,8T / ~104B3,00 $ / 0,30 $15,00 $Custom
Qwen3.8-MaxAPI GA 03/082,4T / 95B2,00 $ / ~0,20 $6,00 $Poids pending
Claude Opus 4.8FerméNDA5,00 $25,00 $API only

03Harness : le premier framework agent maison de DeepSeek

Le changelog du 31 juillet nomme pour la première fois DeepSeek Harness — framework interne pour I/O fichiers, appels d'outils et tâches d'ingénierie multi-étapes, positionné face à Claude Code. Jusqu'ici DeepSeek s'appuyait surtout sur des harness tiers.

Tous les scores agent publiés (Terminal Bench 2.0, Toolathlon) proviennent du mode minimal de Harness (reasoning max, top_p 0,95, temperature 1,0). DeepSeek prévient : « les benchmarks sont extrêmement sensibles au choix de harness. » Tant que Harness n'est pas public et reproduit indépendamment, lisez ces chiffres comme éditeur + framework spécifique, pas capacité générale portable.

04Matrice comparative : open source chinois vs frontier

ModèleLaboIntelligence Index (AA)Coût/tâche (AA)Terminal Bench 2.0
V4-Flash-0731DeepSeek500,03 $82,7 (Harness, éditeur)
Kimi K3Moonshot570,86 $éditeur
GLM-5.2Zhipu~1 pt au-dessus Flashn.d.n.d.
GPT-5.6 SolOpenAI9+ pts au-dessus1,86 $n.d.
Claude Fable 5Anthropic9+ pts au-dessus3,15 $n.d.
V4-Pro PreviewDeepSeekn.d.n.d.67,9 (éditeur)

La tension : sur l'index indépendant, Flash trail Kimi K3 et GLM-5.2, mais domine le coût par tâche — environ 1/29 de K3, 1/62 de GPT-5.6 Sol, 1/105 de Fable 5. Cela explique sept semaines en tête sur OpenRouter : agents à volume, pas chasse au leaderboard. La baisse Luna (−80 %) d'OpenAI répond à la même dynamique « kill line ».

05Controverses : kill line, Liang Wenfeng et rumeurs

  • Dépendance Harness : 82,7 vs 67,9 lié au framework ; reproduction Claude Code / Cursor en attente.
  • Cache et stabilité : faible taux de cache-hit input et timeouts classificateur (21st Century Business Herald).
  • Date V4-Pro : « 10–20 août » via sources non confirmées ; officiellement « dès que possible ».
  • Financement : rumeurs ~7,4 Md$ (Tencent, NetEase) et IPO sans dossier réglementaire.
  • Kill line (斩杀线) : métaphore développeurs chinois — « intelligence suffisante + prix plancher » fixe une barre de survie.
  • Sentiment communautaire : surnom « Liang Baikai » (promesse vide) avant le release ; retour à « Liang Sheng » après 0731.

Le 31 juillet, Nvidia, Broadcom et AMD ont peu bougé — contraste avec le choc R1 début 2025. Le marché traite l'efficacité DeepSeek comme une normalité de l'ingénierie chinoise.

06Runbook en six étapes : migration et choix de modèle

  1. 01
    Audit legacy : chercher deepseek-chat / deepseek-reasoner ; ne garder que deepseek-v4-flash ou deepseek-v4-pro.
  2. 02
    Vérifier le build 0731 : en staging, confirmer que l'API et le changelog pointent vers la version officielle.
  3. 03
    Définir le routage : FAQ, classification et bulk sur Flash (0,28 $/M output) ; raisonnement lourd vers preview V4-Pro ou modèles frontier.
  4. 04
    Stratégie cache : activer le prompt cache ; viser 80 %+ de hits — sinon le miss input (0,14 $/M) grignote l'économie.
  5. 05
    Tester avec votre harness : mesurer avec Cursor, Claude Code ou pipeline maison — ne pas copier les chiffres éditeur.
  6. 06
    Déployer l'hôte CI : sessions agent longues exigent SSH stable et I/O dédiée. Sur la page Tarifs, évaluer les nœuds Mac bare metal NUKCLOUD ; les pools partagés peuvent annuler les économies API par latence de queue.

07Synthèse et FAQ

V4-Flash-0731 prouve que post-entraînement et tarification comptent autant que le scaling en 2026. Pour pipelines agent à volume, Flash est le choix rationnel ; pour profondeur de raisonnement maximale, les modèles frontier restent devant — à prix multiple.

Les équipes qui font tourner des agents V4 sur de gros dépôts ont besoin d'une couche dev/CI stable. Pools partagés, Mac de bureau et VPS surchargés créent jitter réseau, concurrence CPU voisin et coupures de connexion longue durée — friction qui grignote vite les centimes économisés par token. Pour des hôtes agent production, les nœuds Mac bare metal / cloud multi-région NUKCLOUD offrent une capacité Apple Silicon dédiée avec limites locataire claires. Comparez sur la page Tarifs et testez via Commander — voir aussi le runbook ds4 pour self-hosting MIT.

En quoi V4-Flash-0731 diffère-t-il de l'aperçu d'avril ?
Même architecture 284B/13B ; gains uniquement post-entraînement. L'endpoint deepseek-v4-flash pointe vers le build 0731 depuis le 31 juillet.
Quand sortiront V4-Pro officiel et Harness ?
Au 5 août 2026, pas de date confirmée. DeepSeek : « dès que possible ». Fenêtre 10–20 août = rumeur non vérifiée.
Les benchmarks agent sont-ils fiables ?
Terminal Bench 82,7 mesuré avec Harness non publié. SWE-bench Verified plus crédible. Attendre reproduction indépendante.
Flash vs Claude Opus 4.8 en prix ?
Presse chinoise : input miss ~36×, cache-hit ~179×, output ~89× moins cher. Tarifs liste éditeur, non audités.
Flash ou Pro pour pipelines agent ?
Volume et batch : Flash. Raisonnement lourd avec budget : preview V4-Pro. Frontier pour qualité sans limite de coût.

Données au 2026-08-05. Sources : docs API DeepSeek, changelog, rapport arXiv V4, Hugging Face, Artificial Analysis, 21st Century Business Herald, OpenRouter.