DeepSeek V4 version complète (GA) : tarifs, architecture et écart de performance face à GPT-5.6

Après trois mois de preview, DeepSeek V4 atteint la disponibilité générale le 20 juillet 2026 — capacités agent renforcées et tarification heures pleines/creuses pour la première fois, marquant le passage d'une expérimentation quasi gratuite à une exploitation commerciale structurée.

En bref : DeepSeek V4 GA combine poids sous licence MIT, fenêtre de contexte 1M tokens et record open source SWE-bench Verified à 80,6 % pour un coût d'environ 1/10 à 1/100 des modèles propriétaires. Ce guide couvre la chronologie, l'architecture CSA/HCA/mHC/Muon, les tableaux de benchmarks, les comparaisons avec GPT-5.6 et Claude Fable 5, la tarification heures pleines/creuses et la migration API du 24 juillet — plus un runbook en six étapes et une FAQ. Pour un déploiement privé, voir notre guide ds4 d'inférence Mac cloud haute mémoire.

00Qu'est-ce que DeepSeek V4 GA ?

DeepSeek V4 GA (General Availability) est la famille de modèles de production que DeepSeek a mise en ligne le 20 juillet 2026. Elle comprend V4-Pro (1,6T de paramètres) et V4-Flash (284B de paramètres), tous deux publiés sous licence MIT avec une fenêtre de contexte de 1 000 000 tokens et jusqu'à 384K tokens de sortie par requête.

Par rapport à la preview d'avril, la version GA cible les tâches agent, le raisonnement mathématique et la génération de code, et s'accompagne d'une facturation commerciale formelle — la tarification différenciée heures pleines/creuses. Les anciens noms d'endpoint deepseek-chat et deepseek-reasoner seront retirés définitivement le 24 juillet.

  • Auto-hébergeable sous MIT : les entreprises peuvent déployer en privé pour la souveraineté des données et la conformité transfrontalière.
  • Contexte 1M opérationnel : la mémoire du cache KV ne représente que 10 % de V3.2 (7 % sur Flash).
  • Record open source SWE-bench : 80,6 % Verified, à égalité avec Gemini 3.1 Pro pour le meilleur score ouvert.
  • Leader API en rapport qualité-prix : sortie V4-Pro à 0,87 $/M en creux et 1,74 $/M en heures pleines — environ 1/57 de Claude Fable 5.

01Chronologie : de la preview à la version complète

DateÉvénement
2026-04-24Lancement preview V4 + poids ouverts (MIT), V4-Pro (1,6T) et V4-Flash (284B)
2026-05Version optimisée production ; API disponible en général
2026-06Baisse permanente de 75 % sur la sortie V4-Pro (0,87 $/M tokens)
2026-06-29Email à tous les utilisateurs API annonçant la GA mi-juillet et la première divulgation de la tarification heures pleines/creuses
2026-07-19Plusieurs développeurs reçoivent un accès gray-release GA ; la presse évoque une sortie « complète » imminente
2026-07-20Sortie GA production (date de publication de cet article)
2026-07-24Retrait définitif des endpoints deepseek-chat / deepseek-reasoner
Ce qui change : La preview était déjà performante ; la GA ajoute des gains agent, math et code, plus la facturation heures pleines/creuses et un calendrier ferme de retrait des anciens endpoints. Voir notre bilan des baisses de prix IA de juin pour le contexte de la réduction de 75 % sur V4-Pro.

02Analyse approfondie de l'architecture

Vue d'ensemble de la famille de modèles

SpécificationV4-ProV4-Flash
Paramètres totaux1,6 billion (1,6T)284 milliards (284B)
Paramètres actifs par token49 milliards (49B)13 milliards (13B)
Couches Transformer6143
Fenêtre de contexte1 000 000 tokens1 000 000 tokens
Sortie maximale384K tokens384K tokens
PrécisionFP4 (poids experts) + FP8 (reste)FP4 + FP8 mixte
Données de pré-entraînement33T+ tokens32T+ tokens
LicenceMITMIT

Attention hybride (CSA + HCA)

DeepSeek V4 abandonne le MLA des versions V2/V3 au profit d'un hybride de deux nouveaux mécanismes d'attention :

Compressed Sparse Attention (CSA) : les séquences KV sont compressées 4× par pooling à porte Softmax, puis un indexeur FP4 « lightning » sélectionne les top-k tokens sparse (top-1024 sur Pro, top-512 sur Flash) tout en conservant une fenêtre glissante de 128 tokens récents. À 1M tokens, l'inférence ne nécessite que 27 % des FLOPs par rapport à V3.2.

Heavy Compressed Attention (HCA) : les tokens sont compressés 128× avant une attention dense globale pour capturer les dépendances longue portée. Flash utilise HCA sur les deux premières couches, puis alterne CSA et HCA ; Pro suit un schéma similaire.

Effet net : à 1M tokens, la mémoire du cache KV ne représente que 10 % de V3.2 (jusqu'à 7 % sur Flash).

Hyper-connexions à contrainte de variété (mHC) et optimiseur Muon

mHC améliore les connexions résiduelles standard avec un flux résiduel à 4 canaux et des contraintes de matrices doublement stochastiques (polytope de Birkhoff), stabilisant la propagation du signal sur 61 couches. L'optimiseur Muon applique une orthogonalisation Newton-Schulz aux gradients pour une convergence plus rapide et un entraînement plus stable.

Trois modes d'inférence

ModeComportementUsage recommandé
Non-thinkPas de chaîne de pensée ; réponse la plus rapideQ&R simples, routage, classification
Think HighRaisonnement explicite (balises <redacted_thinking>)Tâches de complexité moyenne, débogage de code
Think MaxProfondeur de raisonnement maximale ; nécessite 384K+ de contexteMathématiques difficiles, agents longue durée

Paramètres d'échantillonnage recommandés par DeepSeek : temperature=1.0, top_p=1.0 (tous modes).

03Benchmarks : le tableau de bord open source

BenchmarkDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % (record open source)96,0 %N/D~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3 206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

SWE-bench Verified évalue la correction de bugs sur de vrais dépôts GitHub ; 80,6 % est le meilleur score actuel des modèles ouverts. SWE-bench Pro est plus exigeant — Claude Fable 5 mène à 80,3 %.

Contrôle coût-performance

Données Artificial Analysis sur les tâches d'index Strategy & Ops :

  • Claude Fable 5 : 3,48 $ par exécution, score 50
  • DeepSeek V4-Pro : 0,03 $ par exécution, score 38
  • DeepSeek V4-Flash : moins de 0,04 $ par exécution sur les six types de tâches d'index

Fable 5 coûte 116 fois plus que V4-Pro pour un score supérieur d'environ 12 points (~31 %). À comparer avec notre analyse Kimi K3 : K3 est plus volumineux sur le papier mais la sortie API atteint 15 $/M — V4-Pro domine toujours les charges sensibles au coût.

04Comparaison complète : GPT-5.6 Sol et Claude Fable 5

DimensionDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open sourceLicence MITPropriétairePropriétaire
Auto-hébergeableOuiNonNon
Fenêtre de contexte1M tokensNon communiquée1M tokens
Capacité de codageTrès forte (proche de Fable 5)Très forteLa plus forte
Sortie API (creux)0,87 $/M tokens~15 $/M50 $/M
Sortie API (heures pleines)1,74 $/M tokens
Capacité agentForte ; orchestration multi-agentsForteLa plus forte
Confidentialité des donnéesDéploiement privé possibleNon pris en chargeNon pris en charge

Guide de choix :

  • Budget serré / volume élevé / déploiement privé : V4-Pro ou V4-Flash
  • Qualité de code maximale, coût secondaire : Claude Fable 5 (meilleur SWE-bench Pro)
  • Algorithmes difficiles et raisonnement mathématique : GPT-5.6 Sol / Ultra
  • Ingestion massive de logs ou documents : V4-Flash (entrée cache hit à seulement 0,0028 $/M)

05Tarification heures pleines/creuses : comment réduire la facture

Changement le plus suivi de la GA : la première tarification différenciée heures pleines/creuses de DeepSeek, calquée sur les tarifs électriques horaires. Heures pleines (heure de Pékin) : jours ouvrés de 09:00 à 12:00 et de 14:00 à 18:00, tarifs doublés.

ModèlePosteCreux (Off-Peak)Pleines (Peak)
V4-ProEntrée (cache hit)¥0,025 / 0,0035 $ / 1M×2
Entrée (cache miss)¥3,00 / 0,435 $ / 1M¥6,00 / 0,87 $
Sortie¥6,00 / 0,87 $ / 1M¥12,00 / 1,74 $
V4-FlashEntrée (cache hit)¥0,02 / 0,0028 $ / 1M×2
Entrée (cache miss)¥1,00 / 0,14 $ / 1M¥2,00 / 0,28 $
Sortie¥2,00 / 0,28 $ / 1M¥4,00 / 0,56 $

Quatre leviers pour réduire les coûts :

  1. Planifier les tâches non temps réel hors heures pleines (après 18:00 ou avant 09:00)
  2. Exploiter le cache de prompt — les hits cache V4-Flash ne coûtent que 0,0028 $/M
  3. Routage Flash pour le trafic simple ; escalade vers Pro pour le raisonnement complexe
  4. Surveiller les emails de changement tarifaire (DeepSeek s'engage à un préavis de 24 heures)

Même en heures pleines, la sortie V4-Pro à 1,74 $/M reste 8,6 fois moins chère que Claude Opus 4.8 (15 $/M).

06Guide de migration API (échéance : 24 juillet)

Important : Les anciens noms de modèle deepseek-chat et deepseek-reasoner cessent de répondre le 24 juillet 2026 à 15:59 UTC (23:59 heure de Pékin).
Ancien modèleNouveau modèleRemarques
deepseek-chatdeepseek-v4-flash (mode non-réflexion)Rapide ; adapté aux tâches légères
deepseek-reasonerdeepseek-v4-flash (mode réflexion)Ou migrer vers deepseek-v4-pro pour un raisonnement plus puissant
Migration Python OpenAI SDK
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
)
Appel compatible SDK Anthropic
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

V4 prend en charge les formats OpenAI ChatCompletions et Anthropic Messages. Le base_url reste inchangé — mettez à jour uniquement le paramètre model.

07Runbook en six étapes : déploiement production V4 GA

  1. 01
    Auditer le code : rechercher deepseek-chat et deepseek-reasoner ; lister chaque point d'appel et variable d'environnement.
  2. 02
    Choisir les modèles cibles : dialogue léger vers deepseek-v4-flash ; agents et code complexes vers deepseek-v4-pro ; activer le mode réflexion via extra_body.
  3. 03
    Tests de fumée en staging : avant le 24 juillet, valider la qualité de sortie des modes Non-think, Think High et Think Max en pré-production.
  4. 04
    Configurer la planification heures pleines/creuses : traitement documentaire par lots et revue de code en cron après 18:00 ou le week-end ; viser 80 %+ de taux de cache hit.
  5. 05
    Mettre en place le routage Flash→Pro : classification d'intention et FAQ sur Flash (0,28 $/M en sortie) ; escalade du raisonnement complexe vers Pro.
  6. 06
    Déployer les hôtes d'agents : les sessions agent V4 longue durée exigent SSH stable et compute dédié. Consulter la page Tarifs pour les nœuds Mac dédiés NUKCLOUD comme plan de build CI et agent — la latence de queue sur pools partagés peut annuler les économies API.

08Synthèse et FAQ

DeepSeek V4 GA est l'un des jalons open source les plus importants de 2026. Il ne bat pas Claude Fable 5 ou GPT-5.6 sur tous les axes — pas encore — mais il offre la performance open source la plus forte pour un coût d'environ 1/10 à 1/100 des modèles propriétaires. La tarification heures pleines/creuses ajoute de la complexité opérationnelle, mais les tarifs creux restent très compétitifs. L'évolution de DeepSeek, du disrupteur tarifaire à une plateforme commerciale structurée, signale une maturité.

Les équipes qui font tourner des agents V4 sur de grandes codebases ont toujours besoin d'un plan de développement local et de CI stable et auditable. Pools partagés à la minute, Mac de bureau ou VPS sursouscrits introduisent jitter réseau, contention CPU avec les voisins et ruptures de connexions longues — des frictions qui absorbent rapidement les économies de tokens. Pour des hôtes d'agents en production, les nœuds Mac bare metal multirégionaux / cloud Mac NUKCLOUD offrent du compute Apple Silicon dédié avec des frontières de locataire claires. Comparez les spécifications sur la page Tarifs et provisionnez un essai via Commander.

Quelle différence entre la version GA et la preview ?
La GA apporte des gains ciblés sur les agents, le raisonnement mathématique et la génération de code, plus la facturation heures pleines/creuses. L'architecture MoE 1,6T sous-jacente est inchangée ; stabilité production et systèmes commerciaux sont désormais opérationnels.
Quelles sont les heures pleines ?
Jours ouvrés heure de Pékin 09:00–12:00 et 14:00–18:00 — tarifs doublés. Planifier les tâches par lots après 18:00 pour le tarif creux.
Quand deepseek-chat sera-t-il retiré ?
Le 24 juillet 2026 à 15:59 UTC (23:59 heure de Pékin). Migrer vers deepseek-v4-flash ou deepseek-v4-pro avant cette date.
Peut-on auto-héberger DeepSeek V4 ?
Oui — licence MIT. Un Apple Silicon à mémoire élevée peut exécuter la variante Flash. Voir notre runbook ds4 d'inférence locale.
DeepSeek V4 est-il moins cher que GPT-5.6 ?
La sortie V4-Pro coûte 0,87 $/M en creux et 1,74 $/M en heures pleines — environ 1/17 de GPT-5.6 Sol (~15 $/M). Record open source SWE-bench Verified à 80,6 %.
Quelle infrastructure pour la CI d'agents V4 ?
Les agents V4 longue durée exigent SSH stable, IO disque prévisible et absence de contention avec les voisins. Les nœuds Mac dédiés NUKCLOUD conviennent comme hôtes d'agents et plans de build CI.

Données au 20 juillet 2026. Sources : documentation officielle DeepSeek, arXiv:2606.19348, pages modèles HuggingFace, LLMReference, Artificial Analysis, MangoMind Blog.