Kurzfassung: Entwickler und AI-Entscheider, die nach dem V4-GA-Leitfaden und der 24. Juli-API-Migration noch auf den Flash-Meilenstein warten, erhalten mit Build 0731 eine produktionsreifere Variante — nicht ein neues Modell. Dieser Leitfaden liefert Zeitlinie, Preistabelle, Harness-Kontext, Vergleichsmatrix gegen Kimi K3 und Qwen3.8-Max, Kontroversen, Kill-Line-Hintergrund, Sechs-Schritte-Runbook und FAQ — inklusive NUKCLOUD-Empfehlung für stabile Agent-CI.
00Warum V4-Flash-0731 jetzt relevant ist
V4-Flash-0731 ist kein neues Grundmodell, sondern derselbe 284B MoE / 13B aktiv-Stack wie in der April-Vorschau — mit frischem Post-Training. DeepSeek behauptet, Agent-Benchmarks überträfen die eigene 1,6T V4-Pro-Vorschau, obwohl Flash zehnmal kleiner ist. Das verschiebt die Debatte von „größer = besser“ zu „bessere Nachbearbeitung + günstiger API-Preis“.
- Preisdruck: Output $0,28/M gegen Opus 4.8 $25/M — laut chinesischen Medien bis zu 89× günstiger; Input Cache-Hit $0,0028/M.
- Harness-Abhängigkeit: Terminal Bench 2.0 82,7 vs. V4-Pro-Preview 67,9 — gemessen mit noch nicht öffentlichem Agent-Framework.
- Offene Konkurrenz: Kimi K3 (27. Juli), Qwen3.8-Max (3. Aug.) und GLM-5.2 pressen DeepSeek in die „Kill Line“-Logik.
- Pro ausstehend: V4-Pro offiziell und Harness weiter „bald“ — GA-Fenster 10.–20. August nur Gerücht.
- Praxisprobleme: Entwickler berichten niedrige Cache-Hit-Raten und Safety-Classifier-Timeouts trotz starker Benchmark-Narrative.
01Zeitlinie: April-Vorschau bis August 2026
| Datum | Ereignis |
|---|---|
| 2026-04-24 | V4-Vorschau + Open Weights (MIT): V4-Pro 1,6T/49B, V4-Flash 284B/13B, 1M Kontext |
| 2026-07-20 | V4 GA mit Peak-Valley-Preisen — siehe GA-Artikel |
| 2026-07-24 | deepseek-chat / deepseek-reasoner abgeschaltet; Traffic auf V4-Namen |
| 2026-07-27 | Moonshot veröffentlicht Kimi-K3-Gewichte auf Hugging Face (2,8T) |
| 2026-07-31 | V4-Flash-0731 offizielle API-Beta; Gewichte MIT; erstmals „Harness“ im Changelog; nur API, kein App/Web-Update |
| 2026-08-05 | V4-Pro offiziell und Harness weiter ohne bestätigtes Datum (Publikationsstand) |
02Architektur unverändert — Post-Training macht den Unterschied
Laut Technikbericht DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence bleiben drei Architekturelemente aus der Vorschau bestehen:
- CSA + HCA: Hybrid-Attention (Compressed Sparse + Heavy Compressed) senkt FLOPs und KV-Cache bei 1M Tokens.
- mHC: Manifold-Constrained Hyper-Connections stabilisieren tiefe Residualpfade.
- Muon-Optimierer: Schnellere Konvergenz im Training.
| Modell | Status | Parameter | Input (Miss/Hit) | Output | Lizenz |
|---|---|---|---|---|---|
| V4-Flash-0731 | Offiziell (31.07.) | 284B / 13B | $0,14 / $0,0028 | $0,28 | MIT |
| V4-Pro | Nur Vorschau | 1,6T / 49B | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Gewichte 27.07. | 2,8T / ~104B | $3,00 / $0,30 | $15,00 | Custom |
| Qwen3.8-Max | API GA 03.08. | 2,4T / 95B | $2,00 / ~$0,20 | $6,00 | Weights pending |
| Claude Opus 4.8 | Geschlossen | NDA | $5,00 | $25,00 | API only |
03Harness: DeepSeeks erstes Agent-Framework
Der Changelog vom 31. Juli nennt erstmals DeepSeek Harness — ein Inhouse-Framework für Dateizugriff, Tool-Calls und mehrstufige Engineering-Tasks, positioniert gegen Claude Code. Bisher nutzte DeepSeek überwiegend Drittanbieter-Harnesses.
Alle veröffentlichten Agent-Scores (Terminal Bench 2.0, Toolathlon) stammen aus Harness Minimalmodus (max reasoning, top_p 0,95, temperature 1,0). DeepSeek warnt: „Benchmarks sind extrem harness-sensitiv.“ Bis zur öffentlichen Harness-Version und unabhängiger Reproduktion sind die Zahlen als Hersteller + spezifisches Framework zu lesen — nicht als portierbare Allround-Fähigkeit.
04Vergleichsmatrix: chinesische Open Models vs. Frontier
| Modell | Lab | Intelligence Index (AA) | Kosten/Aufgabe (AA) | Terminal Bench 2.0 |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0,03 | 82,7 (Harness, Hersteller) |
| Kimi K3 | Moonshot | 57 | $0,86 | Hersteller-run |
| GLM-5.2 | Zhipu | ~1 Pkt. über Flash | k. A. | k. A. |
| GPT-5.6 Sol | OpenAI | 9+ Pkt. über Flash | $1,86 | k. A. |
| Claude Fable 5 | Anthropic | 9+ Pkt. über Flash | $3,15 | k. A. |
| V4-Pro Preview | DeepSeek | k. A. | k. A. | 67,9 (Hersteller) |
Die Spannung: Auf dem unabhängigen Index liegt Flash hinter Kimi K3 und GLM-5.2, dominiert aber bei Kosten pro Aufgabe — etwa 1/29 von K3, 1/62 von GPT-5.6 Sol, 1/105 von Fable 5. Das erklärt die sieben Wochen Spitzenplatz auf OpenRouter: Volumen-Agenten statt Leaderboard-Jagd. OpenAIs Luna-Preissenkung (−80 %) reagiert auf dieselbe Kill-Line-Dynamik.
05Kontroversen: Kill Line, Liang Wenfeng und Gerüchte
- Harness-Abhängigkeit: 82,7 vs. 67,9 ist framework-gebunden; Claude Code / Cursor-Reproduktion ausstehend.
- Cache & Stabilität: Entwickler melden niedrige Input-Cache-Hits und Safety-Classifier-Timeouts (21st Century Business Herald).
- V4-Pro-Datum: „8.–20. August“ nur unbestätigte Medienquellen; offiziell „so schnell wie möglich“.
- Finanzierung: Berichte über ~7,4 Mrd. $ Runde (Tencent, NetEase) und IPO-Gerüchte ohne regulatorische Bestätigung.
- Kill Line (斩杀线): Chinesische Community-Metapher — „genug Intelligenz + Bodenpreis“ setzt eine Überlebensgrenze für Wettbewerber.
- Community-Stimmung: Vor dem Release Spitzname „Liang Baikai“ (leeres Versprechen); nach 0731-Rückkehr zu „Liang Sheng“ — Barometer für Erwartungsmanagement.
Am 31. Juli reagierten Nvidia, Broadcom und AMD kaum — im Gegensatz zum R1-Schock Anfang 2025. Der Markt behandelt DeepSeek-Effizienz inzwischen als Normalzustand chinesischer Ingenieursarbeit.
06Sechs-Schritte-Runbook: Migration und Modellauswahl
-
01
Legacy-Audit: Codebase nach
deepseek-chat/deepseek-reasonerdurchsuchen; sicherstellen, dass nurdeepseek-v4-flashoderdeepseek-v4-proaktiv sind. -
02
Build 0731 verifizieren: In Staging API-Antworten und Changelog prüfen;
deepseek-v4-flashsollte automatisch auf 0731 zeigen. -
03
Routing definieren: FAQ, Klassifikation und Bulk auf Flash ($0,28/M Output); schweres Reasoning an V4-Pro-Preview oder Frontier-Modelle eskalieren.
-
04
Cache-Strategie: Prompt-Cache aktivieren; Cache-Hit-Ziel 80 %+ — sonst frisst Miss-Input ($0,14/M) die Token-Ersparnis.
-
05
Harness-realistisch testen: Agent-Scores mit Ihrem produktiven Harness (Cursor, Claude Code, eigene Pipeline) messen — nicht nur Herstellerzahlen übernehmen.
-
06
CI-Host bereitstellen: Langlaufende Agent-Sessions brauchen stabiles SSH und dedizierte IO. Auf der Preisseite NUKCLOUD Bare-Metal-Mac-Knoten als Agent-Build-Ebene prüfen; geteilte Pools können API-Einsparungen durch Tail-Latenz aufzehren.
07Zusammenfassung und FAQ
V4-Flash-0731 ist kein Quantensprung in Parametern, sondern ein Beweis, dass Post-Training und Preisgestaltung 2026 wichtiger werden als reines Scaling. Für volumenstarke Agent-Pipelines ist Flash die rationalere Wahl; für maximale Reasoning-Tiefe bleiben Frontier-Modelle vorn — zum Vielfachen des Preises.
Teams mit dauerhaften V4-Agenten gegen große Repositories brauchen eine stabile lokale Dev- und CI-Schicht. Geteilte Minutenpools, Desktop-Macs und überbuchte VPS erzeugen Bandbreiten-Jitter, Nachbar-CPU-Konkurrenz und abgebrochene Langzeitverbindungen — Reibung, die Cent-pro-Token-Ersparnisse schnell auffrisst. Für produktionsreife Agent-Hosts bieten NUKCLOUD Multi-Region Bare-Metal-Mac- / Cloud-Mac-Knoten dedizierte Apple-Silicon-Kapazität mit klaren Mandantengrenzen. Spezifikationen auf der Preisseite vergleichen und über Bestellen testen — siehe auch ds4-Lokalinferenz-Runbook für MIT-Self-Hosting.
deepseek-v4-flash zeigt seit 31. Juli auf Build 0731.Datenstand: 2026-08-05. Quellen: DeepSeek API-Docs/Changelog, arXiv V4-Report, Hugging Face, Artificial Analysis, 21st Century Business Herald, OpenRouter.