Kurzfassung: DeepSeek V4 GA vereint MIT-lizenzierte Gewichte, 1M Token Kontext und den SWE-bench Verified Open-Source-Rekord von 80,6 % zu Kosten von etwa 1/10 bis 1/100 geschlossener Flaggschiffe. Dieser Leitfaden behandelt Zeitplan, CSA/HCA/mHC/Muon-Architektur, Benchmark-Tabellen, Vergleich mit GPT-5.6 und Claude Fable 5, Peak-Valley-Preise sowie die API-Migration bis 24. Juli — inklusive Sechs-Schritte-Runbook und FAQ. Für private Bereitstellung siehe unser ds4 High-Memory-Mac-Cloud-Inferenz-Runbook.
00Was ist DeepSeek V4 GA?
DeepSeek V4 GA (General Availability) ist die produktionsreife Modellfamilie, die DeepSeek am 20. Juli 2026 freigab. Sie umfasst V4-Pro (1,6 Billionen Parameter) und V4-Flash (284 Milliarden Parameter), beide unter MIT-Lizenz mit 1.000.000 Token Kontextfenster und bis zu 384K Token Ausgabe pro Anfrage.
Gegenüber der April-Vorschau adressiert die GA-Version gezielt Agenten-Aufgaben, mathematisches Reasoning und Codegenerierung und bringt ein formales Abrechnungssystem — Peak-Valley-Differenzpreise. Die Legacy-Endpunktnamen deepseek-chat und deepseek-reasoner werden am 24. Juli dauerhaft abgeschaltet.
- Selbst hostbar unter MIT: Unternehmen können privat deployen und Datensouveränität sowie grenzüberschreitende Compliance sichern.
- 1M Kontext in der Praxis nutzbar: KV-Cache-Speicher beträgt nur 10 % von V3.2 (Flash bis 7 %).
- Open-Source SWE-bench Rekord: 80,6 % Verified, gleichauf mit Gemini 3.1 Pro als bester Open-Score.
- API-Preisführer: V4-Pro Output Off-Peak $0,87/M, Peak $1,74/M — etwa 1/57 von Claude Fable 5.
01Zeitplan: Von der Vorschau zur Vollversion
| Datum | Ereignis |
|---|---|
| 2026-04-24 | V4-Vorschau + Open Weights (MIT), inkl. V4-Pro (1,6T) und V4-Flash (284B) |
| 2026-05 | Produktionsoptimierte Version live; API allgemein verfügbar |
| 2026-06 | V4-Pro Output dauerhaft 75 % günstiger (auf $0,87/M Tokens) |
| 2026-06-29 | E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Peak-Valley-Preise offengelegt |
| 2026-07-19 | Mehrere Entwickler erhalten GA-Grauzugang; Medien melden „Vollversion könnte morgen landen“ |
| 2026-07-20 | GA-Produktionsrelease (Publikationsdatum dieses Artikels) |
| 2026-07-24 | Legacy-Endpunkte deepseek-chat / deepseek-reasoner dauerhaft abgeschaltet |
02Architektur im Detail
Modellfamilie im Überblick
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktive Parameter pro Token | 49 Milliarden (49B) | 13 Milliarden (13B) |
| Transformer-Schichten | 61 | 43 |
| Kontextfenster | 1.000.000 Tokens | 1.000.000 Tokens |
| Maximale Ausgabe | 384K Tokens | 384K Tokens |
| Präzision | FP4 (Experten-Gewichte) + FP8 (übrige) | FP4 + FP8 gemischt |
| Pre-Training-Daten | 33T+ Tokens | 32T+ Tokens |
| Lizenz | MIT | MIT |
Hybride Attention (CSA + HCA)
DeepSeek V4 verzichtet auf das MLA-Design aus V2/V3 zugunsten einer Hybridarchitektur aus zwei neuen Attention-Mechanismen:
Compressed Sparse Attention (CSA): KV-Sequenzen werden per Softmax-gesteuertem Pooling 4× komprimiert; ein FP4-„Lightning Indexer“ wählt sparse Top-k-Tokens (Pro: top-1024, Flash: top-512), während ein 128-Token-Sliding-Window für jüngsten Kontext erhalten bleibt. Bei 1M Tokens benötigt die Inferenz nur 27 % der FLOPs gegenüber V3.2.
Heavy Compressed Attention (HCA): Tokens werden 128× komprimiert, danach globale dichte Attention für Langstreckenabhängigkeiten. Flash nutzt HCA in den ersten zwei Schichten, danach alternieren CSA und HCA; Pro folgt einem ähnlichen Muster.
Gesamteffekt: Bei 1M Tokens beträgt der KV-Cache-Speicher nur 10 % von V3.2 (Flash bis 7 %).
Manifold-Constrained Hyper-Connections (mHC) und Muon-Optimierer
mHC erweitert Standard-Residualverbindungen um einen 4-Kanal-Residualstrom und doppelt-stochastische Matrixbeschränkungen (Birkhoff-Polytop), sodass Signale über 61 Schichten stabil bleiben. Der Muon-Optimierer orthogonalisiert Gradienten per Newton-Schulz für schnellere Konvergenz und stabileres Training.
Drei Inferenzmodi
| Modus | Verhalten | Einsatz |
|---|---|---|
| Non-think | Keine Chain-of-Thought; schnellste Antwort | Einfache Q&A, Routing, Klassifikation |
| Think High | Explizites Reasoning (<redacted_thinking>-Tags) | Mittlere Komplexität, Code-Debugging |
| Think Max | Maximale Reasoning-Tiefe; benötigt 384K+ Kontext | Schwere Mathematik, Langzeit-Agenten |
Offizielle Sampling-Empfehlung: temperature=1.0, top_p=1.0 in allen Modi.
03Benchmarks: Das Open-Source-Zeugnis
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % (Open-Source-Spitze) | 96,0 % | k. A. | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified prüft echte GitHub-Bugfixes; 80,6 % ist der aktuelle Open-Model-Höchstwert. SWE-bench Pro ist strenger — Claude Fable 5 führt mit 80,3 %.
Kosten-Nutzen-Querschnitt
Artificial-Analysis-Daten zu Strategy-&-Ops-Index-Aufgaben:
- Claude Fable 5: $3,48 pro Lauf, Score 50
- DeepSeek V4-Pro: $0,03 pro Lauf, Score 38
- DeepSeek V4-Flash: unter $0,04 pro Lauf über alle sechs Index-Aufgabentypen
Fable 5 kostet 116× mehr als V4-Pro bei nur ~12 Punkten Mehrwert (~31 %). Vergleich mit unserem Kimi-K3-Review: K3 ist auf dem Papier größer, API-Output liegt bei $15/M — V4-Pro dominiert kostensensitive Workloads weiterhin.
04Vollständiger Vergleich: GPT-5.6 Sol und Claude Fable 5
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source | MIT-Lizenz | Geschlossen | Geschlossen |
| Selbst hostbar | Ja | Nein | Nein |
| Kontextfenster | 1M Tokens | Nicht offengelegt | 1M Tokens |
| Code-Fähigkeit | Sehr stark (nahe Fable 5) | Sehr stark | Stärkste |
| API-Output (Off-Peak) | $0,87/M Tokens | ~$15/M | $50/M |
| API-Output (Peak) | $1,74/M Tokens | — | — |
| Agenten-Fähigkeit | Stark; Multi-Agent-Orchestrierung | Stark | Stärkste |
| Datenschutz | Private Bereitstellung möglich | Nicht unterstützt | Nicht unterstützt |
Auswahlhilfe:
- Knappes Budget / hohes Volumen / Private Deploy: V4-Pro oder V4-Flash
- Maximale Code-Qualität, Kosten zweitrangig: Claude Fable 5 (höchster SWE-bench Pro)
- Schwere Algorithmen und Mathe-Reasoning: GPT-5.6 Sol / Ultra
- Massive Log- oder Dokumentenverarbeitung: V4-Flash (Cache-Hit-Input nur $0,0028/M)
05Peak-Valley-Preise: So senken Sie die Kosten
Die meistbeachtete GA-Änderung: DeepSeeks erste Peak-Valley-Differenzpreise, analog zu zeitabhängigen Stromtarifen. Peak-Stunden (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00 — Sätze verdoppeln sich.
| Modell | Position | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Input (Cache-Hit) | ¥0,025 / $0,0035 / 1M | 2× |
| Input (Cache-Miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 | |
| Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 | |
| V4-Flash | Input (Cache-Hit) | ¥0,02 / $0,0028 / 1M | 2× |
| Input (Cache-Miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 | |
| Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
Vier Sparhebel:
- Nicht-echtzeitkritische Jobs außerhalb der Peak-Fenster planen (nach 18:00 oder vor 09:00)
- Prompt Cache nutzen — V4-Flash Cache-Hits kosten nur $0,0028/M
- Einfachen Traffic auf Flash routen; schweres Reasoning an Pro eskalieren
- Abrechnungsänderungs-E-Mails beobachten (DeepSeek kündigt 24 Stunden vorher an)
Selbst im Peak kostet V4-Pro Output mit $1,74/M noch 8,6× weniger als Claude Opus 4.8 ($15/M).
06API-Migrationsleitfaden (Frist: 24. Juli)
deepseek-chat und deepseek-reasoner antworten ab 24. Juli 2026, 15:59 UTC (23:59 Peking-Zeit) nicht mehr.| Legacy-Modell | Neues Modell | Hinweis |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-Thinking-Modus) | Schnell; für leichte Aufgaben |
deepseek-reasoner | deepseek-v4-flash (Thinking-Modus) | Oder Upgrade auf deepseek-v4-pro für stärkeres Reasoning |
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
)
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
V4 unterstützt OpenAI ChatCompletions und Anthropic Messages. Die base_url bleibt gleich — nur den model-Parameter aktualisieren.
07Sechs-Schritte-Runbook: V4 GA in Produktion
-
01
Codebase auditieren: global nach
deepseek-chatunddeepseek-reasonersuchen; alle Aufrufstellen und Umgebungsvariablen listen. -
02
Zielmodelle wählen: leichte Dialoge auf
deepseek-v4-flash; komplexe Agenten/Code aufdeepseek-v4-pro; Thinking-Modus perextra_bodyaktivieren. -
03
Staging-Smoke-Tests: vor dem 24. Juli Non-think, Think High und Think Max in der Vorproduktion auf Output-Qualität prüfen.
-
04
Peak-Valley-Scheduling konfigurieren: Batch-Dokumentenverarbeitung und Code-Review per Cron nach 18:00 oder am Wochenende; Cache-Hit-Ziel 80 %+.
-
05
Flash-zu-Pro-Routing aufbauen: Intent-Klassifikation und FAQ auf Flash ($0,28/M Output); schweres Reasoning an Pro eskalieren.
-
06
Agent-Hosts bereitstellen: langlaufende V4-Agenten-Sessions brauchen stabiles SSH und dedizierte Rechenkapazität. Auf der Preisseite NUKCLOUD dedizierte Mac-Knoten als CI- und Agent-Build-Ebene prüfen — Tail-Latenz in Shared Pools kann API-Kostenvorteile zunichtemachen.
08Zusammenfassung und FAQ
DeepSeek V4 GA ist einer der wichtigsten Open-Model-Meilensteine 2026. Es schlägt Claude Fable 5 oder GPT-5.6 nicht auf jeder Achse — noch nicht — liefert aber die stärkste Open-Source-Leistung zu etwa 1/10 bis 1/100 der Kosten geschlossener Flaggschiffe. Peak-Valley-Preise erhöhen die operative Komplexität, bleiben Off-Peak aber hart konkurrenzfähig. DeepSeeks Weg vom Preisdisruptor zur regelbasierten kommerziellen Plattform ist ein Reifezeichen.
Teams, die V4-Agenten gegen große Codebasen laufen lassen, brauchen weiterhin eine stabile, auditierbare lokale Dev- und CI-Ebene. Geteilte Minutenpools, Schreibtisch-Macs und überbuchte VPS erzeugen Bandbreiten-Jitter, Nachbar-CPU-Konkurrenz und abgebrochene Langzeitverbindungen — Reibung, die Token-Ersparnisse schnell auffrisst. Für produktionsreife Agent-Hosts bieten NUKCLOUD Multi-Region Bare-Metal-Mac- / Cloud-Mac-Knoten dedizierte Apple-Silicon-Kapazität mit klaren Mandantengrenzen. Spezifikationen auf der Preisseite vergleichen und über die Bestellseite testen.
deepseek-v4-flash oder deepseek-v4-pro vorher abschließen.Datenstand: 2026-07-20. Quellen: DeepSeek offizielle Dokumentation, arXiv:2606.19348, HuggingFace-Modellseiten, LLMReference, Artificial Analysis, MangoMind Blog.