Synthèse : Après le guide V4 GA et la migration API du 24 juillet, le build 0731 apporte une variante plus mature — pas un nouveau modèle. Ce guide couvre chronologie, grille tarifaire, contexte Harness, matrice face à Kimi K3 et Qwen3.8-Max, controverses, « kill line », runbook en six étapes et FAQ, avec recommandation NUKCLOUD pour une CI agent stable.
00Pourquoi V4-Flash-0731 compte maintenant
V4-Flash-0731 n'est pas une refonte paramétrique : c'est le même MoE 284B / 13B actifs qu'en avril, avec un post-entraînement refait. DeepSeek affirme que les benchmarks agent dépassent la preview V4-Pro 1,6T — remettant en cause l'équation « plus gros = meilleur ».
- Pression prix : output 0,28 $/M contre 25 $/M pour Opus 4.8 — jusqu'à 89× moins cher selon la presse chinoise ; input cache-hit 0,0028 $/M.
- Dépendance Harness : Terminal Bench 2.0 82,7 vs preview V4-Pro 67,9 — mesuré avec un framework agent non public.
- Concurrence ouverte : Kimi K3 (27 juillet), Qwen3.8-Max (3 août) et GLM-5.2 poussent DeepSeek dans la logique « kill line ».
- Pro en attente : V4-Pro officiel et Harness toujours « bientôt » — fenêtre GA 10–20 août non confirmée.
- Friction terrain : retours développeurs sur faible taux de cache-hit et timeouts du classificateur de sécurité.
01Chronologie : de l'aperçu d'avril à août 2026
| Date | Événement |
|---|---|
| 2026-04-24 | Preview V4 + poids ouverts (MIT) : V4-Pro 1,6T/49B, V4-Flash 284B/13B, contexte 1M |
| 2026-07-20 | GA V4 avec tarification peak-valley — voir article GA |
| 2026-07-24 | Retrait de deepseek-chat / deepseek-reasoner ; trafic vers la famille V4 |
| 2026-07-27 | Moonshot publie les poids Kimi K3 sur Hugging Face (2,8T) |
| 2026-07-31 | V4-Flash-0731 beta API officielle ; poids MIT ; première mention « Harness » ; API seule, pas d'app/web |
| 2026-08-05 | V4-Pro officiel et Harness sans date confirmée (date de publication) |
02Architecture inchangée — le post-entraînement fait la différence
Le rapport technique DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence conserve trois piliers de l'aperçu :
- CSA + HCA : attention hybride réduisant FLOPs et KV cache à 1M tokens.
- mHC : hyper-connexions contraintes stabilisant les résidus profonds.
- Optimiseur Muon : convergence accélérée.
| Modèle | Statut | Paramètres | Input (miss/hit) | Output | Licence |
|---|---|---|---|---|---|
| V4-Flash-0731 | Officiel (31/07) | 284B / 13B | 0,14 $ / 0,0028 $ | 0,28 $ | MIT |
| V4-Pro | Preview seulement | 1,6T / 49B | 0,435 $ / 0,003625 $ | 0,87 $ | MIT |
| Kimi K3 | Poids 27/07 | 2,8T / ~104B | 3,00 $ / 0,30 $ | 15,00 $ | Custom |
| Qwen3.8-Max | API GA 03/08 | 2,4T / 95B | 2,00 $ / ~0,20 $ | 6,00 $ | Poids pending |
| Claude Opus 4.8 | Fermé | NDA | 5,00 $ | 25,00 $ | API only |
03Harness : le premier framework agent maison de DeepSeek
Le changelog du 31 juillet nomme pour la première fois DeepSeek Harness — framework interne pour I/O fichiers, appels d'outils et tâches d'ingénierie multi-étapes, positionné face à Claude Code. Jusqu'ici DeepSeek s'appuyait surtout sur des harness tiers.
Tous les scores agent publiés (Terminal Bench 2.0, Toolathlon) proviennent du mode minimal de Harness (reasoning max, top_p 0,95, temperature 1,0). DeepSeek prévient : « les benchmarks sont extrêmement sensibles au choix de harness. » Tant que Harness n'est pas public et reproduit indépendamment, lisez ces chiffres comme éditeur + framework spécifique, pas capacité générale portable.
04Matrice comparative : open source chinois vs frontier
| Modèle | Labo | Intelligence Index (AA) | Coût/tâche (AA) | Terminal Bench 2.0 |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | 0,03 $ | 82,7 (Harness, éditeur) |
| Kimi K3 | Moonshot | 57 | 0,86 $ | éditeur |
| GLM-5.2 | Zhipu | ~1 pt au-dessus Flash | n.d. | n.d. |
| GPT-5.6 Sol | OpenAI | 9+ pts au-dessus | 1,86 $ | n.d. |
| Claude Fable 5 | Anthropic | 9+ pts au-dessus | 3,15 $ | n.d. |
| V4-Pro Preview | DeepSeek | n.d. | n.d. | 67,9 (éditeur) |
La tension : sur l'index indépendant, Flash trail Kimi K3 et GLM-5.2, mais domine le coût par tâche — environ 1/29 de K3, 1/62 de GPT-5.6 Sol, 1/105 de Fable 5. Cela explique sept semaines en tête sur OpenRouter : agents à volume, pas chasse au leaderboard. La baisse Luna (−80 %) d'OpenAI répond à la même dynamique « kill line ».
05Controverses : kill line, Liang Wenfeng et rumeurs
- Dépendance Harness : 82,7 vs 67,9 lié au framework ; reproduction Claude Code / Cursor en attente.
- Cache et stabilité : faible taux de cache-hit input et timeouts classificateur (21st Century Business Herald).
- Date V4-Pro : « 10–20 août » via sources non confirmées ; officiellement « dès que possible ».
- Financement : rumeurs ~7,4 Md$ (Tencent, NetEase) et IPO sans dossier réglementaire.
- Kill line (斩杀线) : métaphore développeurs chinois — « intelligence suffisante + prix plancher » fixe une barre de survie.
- Sentiment communautaire : surnom « Liang Baikai » (promesse vide) avant le release ; retour à « Liang Sheng » après 0731.
Le 31 juillet, Nvidia, Broadcom et AMD ont peu bougé — contraste avec le choc R1 début 2025. Le marché traite l'efficacité DeepSeek comme une normalité de l'ingénierie chinoise.
06Runbook en six étapes : migration et choix de modèle
-
01
Audit legacy : chercher
deepseek-chat/deepseek-reasoner; ne garder quedeepseek-v4-flashoudeepseek-v4-pro. -
02
Vérifier le build 0731 : en staging, confirmer que l'API et le changelog pointent vers la version officielle.
-
03
Définir le routage : FAQ, classification et bulk sur Flash (0,28 $/M output) ; raisonnement lourd vers preview V4-Pro ou modèles frontier.
-
04
Stratégie cache : activer le prompt cache ; viser 80 %+ de hits — sinon le miss input (0,14 $/M) grignote l'économie.
-
05
Tester avec votre harness : mesurer avec Cursor, Claude Code ou pipeline maison — ne pas copier les chiffres éditeur.
-
06
Déployer l'hôte CI : sessions agent longues exigent SSH stable et I/O dédiée. Sur la page Tarifs, évaluer les nœuds Mac bare metal NUKCLOUD ; les pools partagés peuvent annuler les économies API par latence de queue.
07Synthèse et FAQ
V4-Flash-0731 prouve que post-entraînement et tarification comptent autant que le scaling en 2026. Pour pipelines agent à volume, Flash est le choix rationnel ; pour profondeur de raisonnement maximale, les modèles frontier restent devant — à prix multiple.
Les équipes qui font tourner des agents V4 sur de gros dépôts ont besoin d'une couche dev/CI stable. Pools partagés, Mac de bureau et VPS surchargés créent jitter réseau, concurrence CPU voisin et coupures de connexion longue durée — friction qui grignote vite les centimes économisés par token. Pour des hôtes agent production, les nœuds Mac bare metal / cloud multi-région NUKCLOUD offrent une capacité Apple Silicon dédiée avec limites locataire claires. Comparez sur la page Tarifs et testez via Commander — voir aussi le runbook ds4 pour self-hosting MIT.
deepseek-v4-flash pointe vers le build 0731 depuis le 31 juillet.Données au 2026-08-05. Sources : docs API DeepSeek, changelog, rapport arXiv V4, Hugging Face, Artificial Analysis, 21st Century Business Herald, OpenRouter.