DeepSeek V4 GA (Juli 2026): Preise, Architektur und Benchmarks im Vergleich zu GPT-5.6

Nach drei Monaten Vorschau erreichte DeepSeek V4 am 20. Juli 2026 die allgemeine Verfügbarkeit — mit verbesserten Agenten-Fähigkeiten und erstmals Peak-Valley-Preisen. Damit vollzieht DeepSeek den Schritt von nahezu kostenloser Experimentierphase zu disziplinierter kommerzieller Plattform.

Kurzfassung: DeepSeek V4 GA vereint MIT-lizenzierte Gewichte, 1M Token Kontext und den SWE-bench Verified Open-Source-Rekord von 80,6 % zu Kosten von etwa 1/10 bis 1/100 geschlossener Flaggschiffe. Dieser Leitfaden behandelt Zeitplan, CSA/HCA/mHC/Muon-Architektur, Benchmark-Tabellen, Vergleich mit GPT-5.6 und Claude Fable 5, Peak-Valley-Preise sowie die API-Migration bis 24. Juli — inklusive Sechs-Schritte-Runbook und FAQ. Für private Bereitstellung siehe unser ds4 High-Memory-Mac-Cloud-Inferenz-Runbook.

00Was ist DeepSeek V4 GA?

DeepSeek V4 GA (General Availability) ist die produktionsreife Modellfamilie, die DeepSeek am 20. Juli 2026 freigab. Sie umfasst V4-Pro (1,6 Billionen Parameter) und V4-Flash (284 Milliarden Parameter), beide unter MIT-Lizenz mit 1.000.000 Token Kontextfenster und bis zu 384K Token Ausgabe pro Anfrage.

Gegenüber der April-Vorschau adressiert die GA-Version gezielt Agenten-Aufgaben, mathematisches Reasoning und Codegenerierung und bringt ein formales Abrechnungssystem — Peak-Valley-Differenzpreise. Die Legacy-Endpunktnamen deepseek-chat und deepseek-reasoner werden am 24. Juli dauerhaft abgeschaltet.

  • Selbst hostbar unter MIT: Unternehmen können privat deployen und Datensouveränität sowie grenzüberschreitende Compliance sichern.
  • 1M Kontext in der Praxis nutzbar: KV-Cache-Speicher beträgt nur 10 % von V3.2 (Flash bis 7 %).
  • Open-Source SWE-bench Rekord: 80,6 % Verified, gleichauf mit Gemini 3.1 Pro als bester Open-Score.
  • API-Preisführer: V4-Pro Output Off-Peak $0,87/M, Peak $1,74/M — etwa 1/57 von Claude Fable 5.

01Zeitplan: Von der Vorschau zur Vollversion

DatumEreignis
2026-04-24V4-Vorschau + Open Weights (MIT), inkl. V4-Pro (1,6T) und V4-Flash (284B)
2026-05Produktionsoptimierte Version live; API allgemein verfügbar
2026-06V4-Pro Output dauerhaft 75 % günstiger (auf $0,87/M Tokens)
2026-06-29E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Peak-Valley-Preise offengelegt
2026-07-19Mehrere Entwickler erhalten GA-Grauzugang; Medien melden „Vollversion könnte morgen landen“
2026-07-20GA-Produktionsrelease (Publikationsdatum dieses Artikels)
2026-07-24Legacy-Endpunkte deepseek-chat / deepseek-reasoner dauerhaft abgeschaltet
Kernänderung: Die Vorschau war bereits stark; GA legt Agenten-, Mathe- und Code-Verbesserungen darüber und ergänzt Peak-Valley-Abrechnung plus festes Abschaltdatum für Legacy-Endpunkte. Kontext zum 75-%-V4-Pro-Rabatt in unserer Juni-AI-Preissenkungsübersicht.

02Architektur im Detail

Modellfamilie im Überblick

SpezifikationV4-ProV4-Flash
Gesamtparameter1,6 Billionen (1,6T)284 Milliarden (284B)
Aktive Parameter pro Token49 Milliarden (49B)13 Milliarden (13B)
Transformer-Schichten6143
Kontextfenster1.000.000 Tokens1.000.000 Tokens
Maximale Ausgabe384K Tokens384K Tokens
PräzisionFP4 (Experten-Gewichte) + FP8 (übrige)FP4 + FP8 gemischt
Pre-Training-Daten33T+ Tokens32T+ Tokens
LizenzMITMIT

Hybride Attention (CSA + HCA)

DeepSeek V4 verzichtet auf das MLA-Design aus V2/V3 zugunsten einer Hybridarchitektur aus zwei neuen Attention-Mechanismen:

Compressed Sparse Attention (CSA): KV-Sequenzen werden per Softmax-gesteuertem Pooling 4× komprimiert; ein FP4-„Lightning Indexer“ wählt sparse Top-k-Tokens (Pro: top-1024, Flash: top-512), während ein 128-Token-Sliding-Window für jüngsten Kontext erhalten bleibt. Bei 1M Tokens benötigt die Inferenz nur 27 % der FLOPs gegenüber V3.2.

Heavy Compressed Attention (HCA): Tokens werden 128× komprimiert, danach globale dichte Attention für Langstreckenabhängigkeiten. Flash nutzt HCA in den ersten zwei Schichten, danach alternieren CSA und HCA; Pro folgt einem ähnlichen Muster.

Gesamteffekt: Bei 1M Tokens beträgt der KV-Cache-Speicher nur 10 % von V3.2 (Flash bis 7 %).

Manifold-Constrained Hyper-Connections (mHC) und Muon-Optimierer

mHC erweitert Standard-Residualverbindungen um einen 4-Kanal-Residualstrom und doppelt-stochastische Matrixbeschränkungen (Birkhoff-Polytop), sodass Signale über 61 Schichten stabil bleiben. Der Muon-Optimierer orthogonalisiert Gradienten per Newton-Schulz für schnellere Konvergenz und stabileres Training.

Drei Inferenzmodi

ModusVerhaltenEinsatz
Non-thinkKeine Chain-of-Thought; schnellste AntwortEinfache Q&A, Routing, Klassifikation
Think HighExplizites Reasoning (<redacted_thinking>-Tags)Mittlere Komplexität, Code-Debugging
Think MaxMaximale Reasoning-Tiefe; benötigt 384K+ KontextSchwere Mathematik, Langzeit-Agenten

Offizielle Sampling-Empfehlung: temperature=1.0, top_p=1.0 in allen Modi.

03Benchmarks: Das Open-Source-Zeugnis

BenchmarkDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % (Open-Source-Spitze)96,0 %k. A.~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3.206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

SWE-bench Verified prüft echte GitHub-Bugfixes; 80,6 % ist der aktuelle Open-Model-Höchstwert. SWE-bench Pro ist strenger — Claude Fable 5 führt mit 80,3 %.

Kosten-Nutzen-Querschnitt

Artificial-Analysis-Daten zu Strategy-&-Ops-Index-Aufgaben:

  • Claude Fable 5: $3,48 pro Lauf, Score 50
  • DeepSeek V4-Pro: $0,03 pro Lauf, Score 38
  • DeepSeek V4-Flash: unter $0,04 pro Lauf über alle sechs Index-Aufgabentypen

Fable 5 kostet 116× mehr als V4-Pro bei nur ~12 Punkten Mehrwert (~31 %). Vergleich mit unserem Kimi-K3-Review: K3 ist auf dem Papier größer, API-Output liegt bei $15/M — V4-Pro dominiert kostensensitive Workloads weiterhin.

04Vollständiger Vergleich: GPT-5.6 Sol und Claude Fable 5

DimensionDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open SourceMIT-LizenzGeschlossenGeschlossen
Selbst hostbarJaNeinNein
Kontextfenster1M TokensNicht offengelegt1M Tokens
Code-FähigkeitSehr stark (nahe Fable 5)Sehr starkStärkste
API-Output (Off-Peak)$0,87/M Tokens~$15/M$50/M
API-Output (Peak)$1,74/M Tokens
Agenten-FähigkeitStark; Multi-Agent-OrchestrierungStarkStärkste
DatenschutzPrivate Bereitstellung möglichNicht unterstütztNicht unterstützt

Auswahlhilfe:

  • Knappes Budget / hohes Volumen / Private Deploy: V4-Pro oder V4-Flash
  • Maximale Code-Qualität, Kosten zweitrangig: Claude Fable 5 (höchster SWE-bench Pro)
  • Schwere Algorithmen und Mathe-Reasoning: GPT-5.6 Sol / Ultra
  • Massive Log- oder Dokumentenverarbeitung: V4-Flash (Cache-Hit-Input nur $0,0028/M)

05Peak-Valley-Preise: So senken Sie die Kosten

Die meistbeachtete GA-Änderung: DeepSeeks erste Peak-Valley-Differenzpreise, analog zu zeitabhängigen Stromtarifen. Peak-Stunden (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00 — Sätze verdoppeln sich.

ModellPositionOff-PeakPeak
V4-ProInput (Cache-Hit)¥0,025 / $0,0035 / 1M
Input (Cache-Miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
Output¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashInput (Cache-Hit)¥0,02 / $0,0028 / 1M
Input (Cache-Miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
Output¥2,00 / $0,28 / 1M¥4,00 / $0,56

Vier Sparhebel:

  1. Nicht-echtzeitkritische Jobs außerhalb der Peak-Fenster planen (nach 18:00 oder vor 09:00)
  2. Prompt Cache nutzen — V4-Flash Cache-Hits kosten nur $0,0028/M
  3. Einfachen Traffic auf Flash routen; schweres Reasoning an Pro eskalieren
  4. Abrechnungsänderungs-E-Mails beobachten (DeepSeek kündigt 24 Stunden vorher an)

Selbst im Peak kostet V4-Pro Output mit $1,74/M noch 8,6× weniger als Claude Opus 4.8 ($15/M).

06API-Migrationsleitfaden (Frist: 24. Juli)

Wichtig: Legacy-Modellnamen deepseek-chat und deepseek-reasoner antworten ab 24. Juli 2026, 15:59 UTC (23:59 Peking-Zeit) nicht mehr.
Legacy-ModellNeues ModellHinweis
deepseek-chatdeepseek-v4-flash (Non-Thinking-Modus)Schnell; für leichte Aufgaben
deepseek-reasonerdeepseek-v4-flash (Thinking-Modus)Oder Upgrade auf deepseek-v4-pro für stärkeres Reasoning
Python OpenAI SDK Migration
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
)
Anthropic SDK kompatibler Aufruf
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

V4 unterstützt OpenAI ChatCompletions und Anthropic Messages. Die base_url bleibt gleich — nur den model-Parameter aktualisieren.

07Sechs-Schritte-Runbook: V4 GA in Produktion

  1. 01
    Codebase auditieren: global nach deepseek-chat und deepseek-reasoner suchen; alle Aufrufstellen und Umgebungsvariablen listen.
  2. 02
    Zielmodelle wählen: leichte Dialoge auf deepseek-v4-flash; komplexe Agenten/Code auf deepseek-v4-pro; Thinking-Modus per extra_body aktivieren.
  3. 03
    Staging-Smoke-Tests: vor dem 24. Juli Non-think, Think High und Think Max in der Vorproduktion auf Output-Qualität prüfen.
  4. 04
    Peak-Valley-Scheduling konfigurieren: Batch-Dokumentenverarbeitung und Code-Review per Cron nach 18:00 oder am Wochenende; Cache-Hit-Ziel 80 %+.
  5. 05
    Flash-zu-Pro-Routing aufbauen: Intent-Klassifikation und FAQ auf Flash ($0,28/M Output); schweres Reasoning an Pro eskalieren.
  6. 06
    Agent-Hosts bereitstellen: langlaufende V4-Agenten-Sessions brauchen stabiles SSH und dedizierte Rechenkapazität. Auf der Preisseite NUKCLOUD dedizierte Mac-Knoten als CI- und Agent-Build-Ebene prüfen — Tail-Latenz in Shared Pools kann API-Kostenvorteile zunichtemachen.

08Zusammenfassung und FAQ

DeepSeek V4 GA ist einer der wichtigsten Open-Model-Meilensteine 2026. Es schlägt Claude Fable 5 oder GPT-5.6 nicht auf jeder Achse — noch nicht — liefert aber die stärkste Open-Source-Leistung zu etwa 1/10 bis 1/100 der Kosten geschlossener Flaggschiffe. Peak-Valley-Preise erhöhen die operative Komplexität, bleiben Off-Peak aber hart konkurrenzfähig. DeepSeeks Weg vom Preisdisruptor zur regelbasierten kommerziellen Plattform ist ein Reifezeichen.

Teams, die V4-Agenten gegen große Codebasen laufen lassen, brauchen weiterhin eine stabile, auditierbare lokale Dev- und CI-Ebene. Geteilte Minutenpools, Schreibtisch-Macs und überbuchte VPS erzeugen Bandbreiten-Jitter, Nachbar-CPU-Konkurrenz und abgebrochene Langzeitverbindungen — Reibung, die Token-Ersparnisse schnell auffrisst. Für produktionsreife Agent-Hosts bieten NUKCLOUD Multi-Region Bare-Metal-Mac- / Cloud-Mac-Knoten dedizierte Apple-Silicon-Kapazität mit klaren Mandantengrenzen. Spezifikationen auf der Preisseite vergleichen und über die Bestellseite testen.

Worin unterscheidet sich die GA-Version von der Vorschau?
GA bringt gezielte Verbesserungen bei Agenten, Mathe und Codegenerierung plus Peak-Valley-Abrechnung. Die 1,6T-MoE-Architektur bleibt; Produktionsstabilität und kommerzielle Systeme sind vollständig einsatzbereit.
Wann gelten Peak-Preise?
Peking-Werktags 09:00–12:00 und 14:00–18:00 — Sätze verdoppeln sich. Batch-Jobs nach 18:00 für Off-Peak-Preise planen.
Wann wird deepseek-chat abgeschaltet?
24. Juli 2026, 15:59 UTC (23:59 Peking-Zeit). Migration auf deepseek-v4-flash oder deepseek-v4-pro vorher abschließen.
Kann man DeepSeek V4 selbst hosten?
Ja — MIT-Lizenz. High-Memory-Apple-Silicon kann die Flash-Variante betreiben. Siehe unser ds4-Lokalinferenz-Runbook.
Ist DeepSeek V4 günstiger als GPT-5.6?
V4-Pro Output kostet Off-Peak $0,87/M und Peak $1,74/M — etwa 1/17 von GPT-5.6 Sol (~$15/M). Zudem SWE-bench Verified Open-Source-Rekord 80,6 %.
Welche Infrastruktur eignet sich für V4-Agent-CI?
Langlaufende V4-Agenten brauchen stabiles SSH, vorhersagbare Disk-IO und keine Nachbar-Konkurrenz. NUKCLOUD dedizierte Mac-Knoten eignen sich als Agent-Host und CI-Build-Ebene.

Datenstand: 2026-07-20. Quellen: DeepSeek offizielle Dokumentation, arXiv:2606.19348, HuggingFace-Modellseiten, LLMReference, Artificial Analysis, MangoMind Blog.