En bref : DeepSeek V4 GA combine poids sous licence MIT, fenêtre de contexte 1M tokens et record open source SWE-bench Verified à 80,6 % pour un coût d'environ 1/10 à 1/100 des modèles propriétaires. Ce guide couvre la chronologie, l'architecture CSA/HCA/mHC/Muon, les tableaux de benchmarks, les comparaisons avec GPT-5.6 et Claude Fable 5, la tarification heures pleines/creuses et la migration API du 24 juillet — plus un runbook en six étapes et une FAQ. Pour un déploiement privé, voir notre guide ds4 d'inférence Mac cloud haute mémoire.
00Qu'est-ce que DeepSeek V4 GA ?
DeepSeek V4 GA (General Availability) est la famille de modèles de production que DeepSeek a mise en ligne le 20 juillet 2026. Elle comprend V4-Pro (1,6T de paramètres) et V4-Flash (284B de paramètres), tous deux publiés sous licence MIT avec une fenêtre de contexte de 1 000 000 tokens et jusqu'à 384K tokens de sortie par requête.
Par rapport à la preview d'avril, la version GA cible les tâches agent, le raisonnement mathématique et la génération de code, et s'accompagne d'une facturation commerciale formelle — la tarification différenciée heures pleines/creuses. Les anciens noms d'endpoint deepseek-chat et deepseek-reasoner seront retirés définitivement le 24 juillet.
- Auto-hébergeable sous MIT : les entreprises peuvent déployer en privé pour la souveraineté des données et la conformité transfrontalière.
- Contexte 1M opérationnel : la mémoire du cache KV ne représente que 10 % de V3.2 (7 % sur Flash).
- Record open source SWE-bench : 80,6 % Verified, à égalité avec Gemini 3.1 Pro pour le meilleur score ouvert.
- Leader API en rapport qualité-prix : sortie V4-Pro à 0,87 $/M en creux et 1,74 $/M en heures pleines — environ 1/57 de Claude Fable 5.
01Chronologie : de la preview à la version complète
| Date | Événement |
|---|---|
| 2026-04-24 | Lancement preview V4 + poids ouverts (MIT), V4-Pro (1,6T) et V4-Flash (284B) |
| 2026-05 | Version optimisée production ; API disponible en général |
| 2026-06 | Baisse permanente de 75 % sur la sortie V4-Pro (0,87 $/M tokens) |
| 2026-06-29 | Email à tous les utilisateurs API annonçant la GA mi-juillet et la première divulgation de la tarification heures pleines/creuses |
| 2026-07-19 | Plusieurs développeurs reçoivent un accès gray-release GA ; la presse évoque une sortie « complète » imminente |
| 2026-07-20 | Sortie GA production (date de publication de cet article) |
| 2026-07-24 | Retrait définitif des endpoints deepseek-chat / deepseek-reasoner |
02Analyse approfondie de l'architecture
Vue d'ensemble de la famille de modèles
| Spécification | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion (1,6T) | 284 milliards (284B) |
| Paramètres actifs par token | 49 milliards (49B) | 13 milliards (13B) |
| Couches Transformer | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Sortie maximale | 384K tokens | 384K tokens |
| Précision | FP4 (poids experts) + FP8 (reste) | FP4 + FP8 mixte |
| Données de pré-entraînement | 33T+ tokens | 32T+ tokens |
| Licence | MIT | MIT |
Attention hybride (CSA + HCA)
DeepSeek V4 abandonne le MLA des versions V2/V3 au profit d'un hybride de deux nouveaux mécanismes d'attention :
Compressed Sparse Attention (CSA) : les séquences KV sont compressées 4× par pooling à porte Softmax, puis un indexeur FP4 « lightning » sélectionne les top-k tokens sparse (top-1024 sur Pro, top-512 sur Flash) tout en conservant une fenêtre glissante de 128 tokens récents. À 1M tokens, l'inférence ne nécessite que 27 % des FLOPs par rapport à V3.2.
Heavy Compressed Attention (HCA) : les tokens sont compressés 128× avant une attention dense globale pour capturer les dépendances longue portée. Flash utilise HCA sur les deux premières couches, puis alterne CSA et HCA ; Pro suit un schéma similaire.
Effet net : à 1M tokens, la mémoire du cache KV ne représente que 10 % de V3.2 (jusqu'à 7 % sur Flash).
Hyper-connexions à contrainte de variété (mHC) et optimiseur Muon
mHC améliore les connexions résiduelles standard avec un flux résiduel à 4 canaux et des contraintes de matrices doublement stochastiques (polytope de Birkhoff), stabilisant la propagation du signal sur 61 couches. L'optimiseur Muon applique une orthogonalisation Newton-Schulz aux gradients pour une convergence plus rapide et un entraînement plus stable.
Trois modes d'inférence
| Mode | Comportement | Usage recommandé |
|---|---|---|
| Non-think | Pas de chaîne de pensée ; réponse la plus rapide | Q&R simples, routage, classification |
| Think High | Raisonnement explicite (balises <redacted_thinking>) | Tâches de complexité moyenne, débogage de code |
| Think Max | Profondeur de raisonnement maximale ; nécessite 384K+ de contexte | Mathématiques difficiles, agents longue durée |
Paramètres d'échantillonnage recommandés par DeepSeek : temperature=1.0, top_p=1.0 (tous modes).
03Benchmarks : le tableau de bord open source
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % (record open source) | 96,0 % | N/D | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified évalue la correction de bugs sur de vrais dépôts GitHub ; 80,6 % est le meilleur score actuel des modèles ouverts. SWE-bench Pro est plus exigeant — Claude Fable 5 mène à 80,3 %.
Contrôle coût-performance
Données Artificial Analysis sur les tâches d'index Strategy & Ops :
- Claude Fable 5 : 3,48 $ par exécution, score 50
- DeepSeek V4-Pro : 0,03 $ par exécution, score 38
- DeepSeek V4-Flash : moins de 0,04 $ par exécution sur les six types de tâches d'index
Fable 5 coûte 116 fois plus que V4-Pro pour un score supérieur d'environ 12 points (~31 %). À comparer avec notre analyse Kimi K3 : K3 est plus volumineux sur le papier mais la sortie API atteint 15 $/M — V4-Pro domine toujours les charges sensibles au coût.
04Comparaison complète : GPT-5.6 Sol et Claude Fable 5
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source | Licence MIT | Propriétaire | Propriétaire |
| Auto-hébergeable | Oui | Non | Non |
| Fenêtre de contexte | 1M tokens | Non communiquée | 1M tokens |
| Capacité de codage | Très forte (proche de Fable 5) | Très forte | La plus forte |
| Sortie API (creux) | 0,87 $/M tokens | ~15 $/M | 50 $/M |
| Sortie API (heures pleines) | 1,74 $/M tokens | — | — |
| Capacité agent | Forte ; orchestration multi-agents | Forte | La plus forte |
| Confidentialité des données | Déploiement privé possible | Non pris en charge | Non pris en charge |
Guide de choix :
- Budget serré / volume élevé / déploiement privé : V4-Pro ou V4-Flash
- Qualité de code maximale, coût secondaire : Claude Fable 5 (meilleur SWE-bench Pro)
- Algorithmes difficiles et raisonnement mathématique : GPT-5.6 Sol / Ultra
- Ingestion massive de logs ou documents : V4-Flash (entrée cache hit à seulement 0,0028 $/M)
05Tarification heures pleines/creuses : comment réduire la facture
Changement le plus suivi de la GA : la première tarification différenciée heures pleines/creuses de DeepSeek, calquée sur les tarifs électriques horaires. Heures pleines (heure de Pékin) : jours ouvrés de 09:00 à 12:00 et de 14:00 à 18:00, tarifs doublés.
| Modèle | Poste | Creux (Off-Peak) | Pleines (Peak) |
|---|---|---|---|
| V4-Pro | Entrée (cache hit) | ¥0,025 / 0,0035 $ / 1M | ×2 |
| Entrée (cache miss) | ¥3,00 / 0,435 $ / 1M | ¥6,00 / 0,87 $ | |
| Sortie | ¥6,00 / 0,87 $ / 1M | ¥12,00 / 1,74 $ | |
| V4-Flash | Entrée (cache hit) | ¥0,02 / 0,0028 $ / 1M | ×2 |
| Entrée (cache miss) | ¥1,00 / 0,14 $ / 1M | ¥2,00 / 0,28 $ | |
| Sortie | ¥2,00 / 0,28 $ / 1M | ¥4,00 / 0,56 $ |
Quatre leviers pour réduire les coûts :
- Planifier les tâches non temps réel hors heures pleines (après 18:00 ou avant 09:00)
- Exploiter le cache de prompt — les hits cache V4-Flash ne coûtent que 0,0028 $/M
- Routage Flash pour le trafic simple ; escalade vers Pro pour le raisonnement complexe
- Surveiller les emails de changement tarifaire (DeepSeek s'engage à un préavis de 24 heures)
Même en heures pleines, la sortie V4-Pro à 1,74 $/M reste 8,6 fois moins chère que Claude Opus 4.8 (15 $/M).
06Guide de migration API (échéance : 24 juillet)
deepseek-chat et deepseek-reasoner cessent de répondre le 24 juillet 2026 à 15:59 UTC (23:59 heure de Pékin).| Ancien modèle | Nouveau modèle | Remarques |
|---|---|---|
deepseek-chat | deepseek-v4-flash (mode non-réflexion) | Rapide ; adapté aux tâches légères |
deepseek-reasoner | deepseek-v4-flash (mode réflexion) | Ou migrer vers deepseek-v4-pro pour un raisonnement plus puissant |
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
)
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
V4 prend en charge les formats OpenAI ChatCompletions et Anthropic Messages. Le base_url reste inchangé — mettez à jour uniquement le paramètre model.
07Runbook en six étapes : déploiement production V4 GA
-
01
Auditer le code : rechercher
deepseek-chatetdeepseek-reasoner; lister chaque point d'appel et variable d'environnement. -
02
Choisir les modèles cibles : dialogue léger vers
deepseek-v4-flash; agents et code complexes versdeepseek-v4-pro; activer le mode réflexion viaextra_body. -
03
Tests de fumée en staging : avant le 24 juillet, valider la qualité de sortie des modes Non-think, Think High et Think Max en pré-production.
-
04
Configurer la planification heures pleines/creuses : traitement documentaire par lots et revue de code en cron après 18:00 ou le week-end ; viser 80 %+ de taux de cache hit.
-
05
Mettre en place le routage Flash→Pro : classification d'intention et FAQ sur Flash (0,28 $/M en sortie) ; escalade du raisonnement complexe vers Pro.
-
06
Déployer les hôtes d'agents : les sessions agent V4 longue durée exigent SSH stable et compute dédié. Consulter la page Tarifs pour les nœuds Mac dédiés NUKCLOUD comme plan de build CI et agent — la latence de queue sur pools partagés peut annuler les économies API.
08Synthèse et FAQ
DeepSeek V4 GA est l'un des jalons open source les plus importants de 2026. Il ne bat pas Claude Fable 5 ou GPT-5.6 sur tous les axes — pas encore — mais il offre la performance open source la plus forte pour un coût d'environ 1/10 à 1/100 des modèles propriétaires. La tarification heures pleines/creuses ajoute de la complexité opérationnelle, mais les tarifs creux restent très compétitifs. L'évolution de DeepSeek, du disrupteur tarifaire à une plateforme commerciale structurée, signale une maturité.
Les équipes qui font tourner des agents V4 sur de grandes codebases ont toujours besoin d'un plan de développement local et de CI stable et auditable. Pools partagés à la minute, Mac de bureau ou VPS sursouscrits introduisent jitter réseau, contention CPU avec les voisins et ruptures de connexions longues — des frictions qui absorbent rapidement les économies de tokens. Pour des hôtes d'agents en production, les nœuds Mac bare metal multirégionaux / cloud Mac NUKCLOUD offrent du compute Apple Silicon dédié avec des frontières de locataire claires. Comparez les spécifications sur la page Tarifs et provisionnez un essai via Commander.
deepseek-v4-flash ou deepseek-v4-pro avant cette date.Données au 20 juillet 2026. Sources : documentation officielle DeepSeek, arXiv:2606.19348, pages modèles HuggingFace, LLMReference, Artificial Analysis, MangoMind Blog.