DeepSeek V4-Flash-0731 (Aug. 2026): Offizielle Benchmarks, Preise und Vergleich mit Claude Opus 4.8

Am 31. Juli 2026 stufte DeepSeek V4-Flash-0731 zur offiziellen API-Version hoch — gleiche 284B/13B-Architektur wie im April, Gewinne nur aus Post-Training. Agent-Benchmarks überholen die eigene V4-Pro-Vorschau; Preise liegen bei einem Bruchteil von Claude Opus 4.8. Flaggschiff V4-Pro und das Agent-Framework Harness bleiben unveröffentlicht.

Kurzfassung: Entwickler und AI-Entscheider, die nach dem V4-GA-Leitfaden und der 24. Juli-API-Migration noch auf den Flash-Meilenstein warten, erhalten mit Build 0731 eine produktionsreifere Variante — nicht ein neues Modell. Dieser Leitfaden liefert Zeitlinie, Preistabelle, Harness-Kontext, Vergleichsmatrix gegen Kimi K3 und Qwen3.8-Max, Kontroversen, Kill-Line-Hintergrund, Sechs-Schritte-Runbook und FAQ — inklusive NUKCLOUD-Empfehlung für stabile Agent-CI.

00Warum V4-Flash-0731 jetzt relevant ist

V4-Flash-0731 ist kein neues Grundmodell, sondern derselbe 284B MoE / 13B aktiv-Stack wie in der April-Vorschau — mit frischem Post-Training. DeepSeek behauptet, Agent-Benchmarks überträfen die eigene 1,6T V4-Pro-Vorschau, obwohl Flash zehnmal kleiner ist. Das verschiebt die Debatte von „größer = besser“ zu „bessere Nachbearbeitung + günstiger API-Preis“.

  • Preisdruck: Output $0,28/M gegen Opus 4.8 $25/M — laut chinesischen Medien bis zu 89× günstiger; Input Cache-Hit $0,0028/M.
  • Harness-Abhängigkeit: Terminal Bench 2.0 82,7 vs. V4-Pro-Preview 67,9 — gemessen mit noch nicht öffentlichem Agent-Framework.
  • Offene Konkurrenz: Kimi K3 (27. Juli), Qwen3.8-Max (3. Aug.) und GLM-5.2 pressen DeepSeek in die „Kill Line“-Logik.
  • Pro ausstehend: V4-Pro offiziell und Harness weiter „bald“ — GA-Fenster 10.–20. August nur Gerücht.
  • Praxisprobleme: Entwickler berichten niedrige Cache-Hit-Raten und Safety-Classifier-Timeouts trotz starker Benchmark-Narrative.

01Zeitlinie: April-Vorschau bis August 2026

DatumEreignis
2026-04-24V4-Vorschau + Open Weights (MIT): V4-Pro 1,6T/49B, V4-Flash 284B/13B, 1M Kontext
2026-07-20V4 GA mit Peak-Valley-Preisen — siehe GA-Artikel
2026-07-24deepseek-chat / deepseek-reasoner abgeschaltet; Traffic auf V4-Namen
2026-07-27Moonshot veröffentlicht Kimi-K3-Gewichte auf Hugging Face (2,8T)
2026-07-31V4-Flash-0731 offizielle API-Beta; Gewichte MIT; erstmals „Harness“ im Changelog; nur API, kein App/Web-Update
2026-08-05V4-Pro offiziell und Harness weiter ohne bestätigtes Datum (Publikationsstand)

02Architektur unverändert — Post-Training macht den Unterschied

Laut Technikbericht DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence bleiben drei Architekturelemente aus der Vorschau bestehen:

  • CSA + HCA: Hybrid-Attention (Compressed Sparse + Heavy Compressed) senkt FLOPs und KV-Cache bei 1M Tokens.
  • mHC: Manifold-Constrained Hyper-Connections stabilisieren tiefe Residualpfade.
  • Muon-Optimierer: Schnellere Konvergenz im Training.
Drei harte Kennzahlen (Herstellerangaben): Bei 1M Kontext benötigt V4-Pro nur 27 % der FLOPs und 10 % des KV-Cache von V3.2. Artificial Analysis Intelligence Index für V4-Flash-0731: 50 bei $0,03 pro Aufgabe — Kimi K3: 57 / $0,86; GPT-5.6 Sol und Claude Fable 5 jeweils 9+ Punkte höher, aber $1,86 bzw. $3,15 pro Aufgabe.
ModellStatusParameterInput (Miss/Hit)OutputLizenz
V4-Flash-0731Offiziell (31.07.)284B / 13B$0,14 / $0,0028$0,28MIT
V4-ProNur Vorschau1,6T / 49B$0,435 / $0,003625$0,87MIT
Kimi K3Gewichte 27.07.2,8T / ~104B$3,00 / $0,30$15,00Custom
Qwen3.8-MaxAPI GA 03.08.2,4T / 95B$2,00 / ~$0,20$6,00Weights pending
Claude Opus 4.8GeschlossenNDA$5,00$25,00API only

03Harness: DeepSeeks erstes Agent-Framework

Der Changelog vom 31. Juli nennt erstmals DeepSeek Harness — ein Inhouse-Framework für Dateizugriff, Tool-Calls und mehrstufige Engineering-Tasks, positioniert gegen Claude Code. Bisher nutzte DeepSeek überwiegend Drittanbieter-Harnesses.

Alle veröffentlichten Agent-Scores (Terminal Bench 2.0, Toolathlon) stammen aus Harness Minimalmodus (max reasoning, top_p 0,95, temperature 1,0). DeepSeek warnt: „Benchmarks sind extrem harness-sensitiv.“ Bis zur öffentlichen Harness-Version und unabhängiger Reproduktion sind die Zahlen als Hersteller + spezifisches Framework zu lesen — nicht als portierbare Allround-Fähigkeit.

04Vergleichsmatrix: chinesische Open Models vs. Frontier

ModellLabIntelligence Index (AA)Kosten/Aufgabe (AA)Terminal Bench 2.0
V4-Flash-0731DeepSeek50$0,0382,7 (Harness, Hersteller)
Kimi K3Moonshot57$0,86Hersteller-run
GLM-5.2Zhipu~1 Pkt. über Flashk. A.k. A.
GPT-5.6 SolOpenAI9+ Pkt. über Flash$1,86k. A.
Claude Fable 5Anthropic9+ Pkt. über Flash$3,15k. A.
V4-Pro PreviewDeepSeekk. A.k. A.67,9 (Hersteller)

Die Spannung: Auf dem unabhängigen Index liegt Flash hinter Kimi K3 und GLM-5.2, dominiert aber bei Kosten pro Aufgabe — etwa 1/29 von K3, 1/62 von GPT-5.6 Sol, 1/105 von Fable 5. Das erklärt die sieben Wochen Spitzenplatz auf OpenRouter: Volumen-Agenten statt Leaderboard-Jagd. OpenAIs Luna-Preissenkung (−80 %) reagiert auf dieselbe Kill-Line-Dynamik.

05Kontroversen: Kill Line, Liang Wenfeng und Gerüchte

  • Harness-Abhängigkeit: 82,7 vs. 67,9 ist framework-gebunden; Claude Code / Cursor-Reproduktion ausstehend.
  • Cache & Stabilität: Entwickler melden niedrige Input-Cache-Hits und Safety-Classifier-Timeouts (21st Century Business Herald).
  • V4-Pro-Datum: „8.–20. August“ nur unbestätigte Medienquellen; offiziell „so schnell wie möglich“.
  • Finanzierung: Berichte über ~7,4 Mrd. $ Runde (Tencent, NetEase) und IPO-Gerüchte ohne regulatorische Bestätigung.
  • Kill Line (斩杀线): Chinesische Community-Metapher — „genug Intelligenz + Bodenpreis“ setzt eine Überlebensgrenze für Wettbewerber.
  • Community-Stimmung: Vor dem Release Spitzname „Liang Baikai“ (leeres Versprechen); nach 0731-Rückkehr zu „Liang Sheng“ — Barometer für Erwartungsmanagement.

Am 31. Juli reagierten Nvidia, Broadcom und AMD kaum — im Gegensatz zum R1-Schock Anfang 2025. Der Markt behandelt DeepSeek-Effizienz inzwischen als Normalzustand chinesischer Ingenieursarbeit.

06Sechs-Schritte-Runbook: Migration und Modellauswahl

  1. 01
    Legacy-Audit: Codebase nach deepseek-chat / deepseek-reasoner durchsuchen; sicherstellen, dass nur deepseek-v4-flash oder deepseek-v4-pro aktiv sind.
  2. 02
    Build 0731 verifizieren: In Staging API-Antworten und Changelog prüfen; deepseek-v4-flash sollte automatisch auf 0731 zeigen.
  3. 03
    Routing definieren: FAQ, Klassifikation und Bulk auf Flash ($0,28/M Output); schweres Reasoning an V4-Pro-Preview oder Frontier-Modelle eskalieren.
  4. 04
    Cache-Strategie: Prompt-Cache aktivieren; Cache-Hit-Ziel 80 %+ — sonst frisst Miss-Input ($0,14/M) die Token-Ersparnis.
  5. 05
    Harness-realistisch testen: Agent-Scores mit Ihrem produktiven Harness (Cursor, Claude Code, eigene Pipeline) messen — nicht nur Herstellerzahlen übernehmen.
  6. 06
    CI-Host bereitstellen: Langlaufende Agent-Sessions brauchen stabiles SSH und dedizierte IO. Auf der Preisseite NUKCLOUD Bare-Metal-Mac-Knoten als Agent-Build-Ebene prüfen; geteilte Pools können API-Einsparungen durch Tail-Latenz aufzehren.

07Zusammenfassung und FAQ

V4-Flash-0731 ist kein Quantensprung in Parametern, sondern ein Beweis, dass Post-Training und Preisgestaltung 2026 wichtiger werden als reines Scaling. Für volumenstarke Agent-Pipelines ist Flash die rationalere Wahl; für maximale Reasoning-Tiefe bleiben Frontier-Modelle vorn — zum Vielfachen des Preises.

Teams mit dauerhaften V4-Agenten gegen große Repositories brauchen eine stabile lokale Dev- und CI-Schicht. Geteilte Minutenpools, Desktop-Macs und überbuchte VPS erzeugen Bandbreiten-Jitter, Nachbar-CPU-Konkurrenz und abgebrochene Langzeitverbindungen — Reibung, die Cent-pro-Token-Ersparnisse schnell auffrisst. Für produktionsreife Agent-Hosts bieten NUKCLOUD Multi-Region Bare-Metal-Mac- / Cloud-Mac-Knoten dedizierte Apple-Silicon-Kapazität mit klaren Mandantengrenzen. Spezifikationen auf der Preisseite vergleichen und über Bestellen testen — siehe auch ds4-Lokalinferenz-Runbook für MIT-Self-Hosting.

Was unterscheidet V4-Flash-0731 von der April-Vorschau?
Gleiche 284B/13B-Architektur; Leistungsgewinn ausschließlich aus neuem Post-Training. API-Endpunkt deepseek-v4-flash zeigt seit 31. Juli auf Build 0731.
Wann erscheinen V4-Pro offiziell und Harness?
Stand 5. August 2026 ohne bestätigtes Datum. DeepSeek: „so schnell wie möglich“. GA-Fenster 10.–20. August ist unbestätigtes Gerücht.
Sind die Agent-Benchmarks vertrauenswürdig?
Terminal Bench 82,7 wurde mit unreleased Harness Minimalmodus gemessen. SWE-bench Verified hat höhere Glaubwürdigkeit. Auf unabhängige Reproduktion warten.
Wie günstig ist Flash vs. Claude Opus 4.8?
Medienberichte: Input Miss ~36×, Cache-Hit ~179×, Output ~89× günstiger. Herstellerlistenpreise, keine Audit-Bestätigung.
Flash oder Pro für Agent-Pipelines?
Volumen und Batch: Flash. Schweres Reasoning mit Budget: V4-Pro-Preview bis offizielles Pro erscheint. Frontier für Spitzenqualität ohne Kostenlimit.

Datenstand: 2026-08-05. Quellen: DeepSeek API-Docs/Changelog, arXiv V4-Report, Hugging Face, Artificial Analysis, 21st Century Business Herald, OpenRouter.