DeepSeek V4-Flash-0731: официальный релиз, бенчмарки vs Opus 4.8 и ценовая «линия уничтожения»

31 июля 2026 DeepSeek перевёл V4-Flash-0731 в официальную API-версию — та же архитектура 284B/13B, что в апреле; прирост только из post-training. Agent-бенчмарки обходят собственный preview V4-Pro; цена — доля от Claude Opus 4.8. Флагман V4-Pro и agent framework Harness остаются неопубликованными.

Тезис: После гайда V4 GA и API-миграции 24 июля build 0731 даёт более зрелую вариацию — не новую модель. Ниже: таймлайн, таблица цен, контекст Harness, матрица vs Kimi K3 и Qwen3.8-Max, споры, «линия уничтожения», 6-шаговый runbook и FAQ — с рекомендацией NUKCLOUD для стабильной agent-CI.

00Почему V4-Flash-0731 важен сейчас

V4-Flash-0731 — не новый foundation model, а тот же MoE 284B / 13B active, что в апреле, с перезапуском post-training. DeepSeek заявляет, что agent-бенчмарки обходят preview V4-Pro 1,6T — ломая аксиому «больше = лучше».

  • Ценовой пресс: output $0,28/M против $25/M у Opus 4.8 — до 89× дешевле по китайским медиа; input cache-hit $0,0028/M.
  • Harness-dependency: Terminal Bench 2.0 82,7 vs preview V4-Pro 67,9 — на неопубликованном agent framework.
  • Open-конкуренция: Kimi K3 (27 июля), Qwen3.8-Max (3 августа) и GLM-5.2 давят DeepSeek в логику «kill line».
  • Pro в ожидании: официальный V4-Pro и Harness — «скоро»; окно GA 10–20 августа не подтверждено.
  • Production friction: dev-сообщество сообщает о низком cache-hit и timeout safety classifier.

01Таймлайн: от апрельского preview до августа 2026

ДатаСобытие
2026-04-24Preview V4 + open weights (MIT): V4-Pro 1,6T/49B, V4-Flash 284B/13B, контекст 1M
2026-07-20GA V4 с peak-valley pricing — см. статью GA
2026-07-24Отключены deepseek-chat / deepseek-reasoner; трафик на семейство V4
2026-07-27Moonshot публикует веса Kimi K3 на Hugging Face (2,8T)
2026-07-31V4-Flash-0731 официальная API beta; веса MIT; первое упоминание Harness; только API
2026-08-05Официальный V4-Pro и Harness без подтверждённой даты (дата публикации)

02Архитектура без изменений — post-training решает

Техотчёт DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence сохраняет три элемента preview:

  • CSA + HCA: гибридное attention снижает FLOPs и KV cache на 1M токенов.
  • mHC: manifold-constrained hyper-connections стабилизируют deep residual paths.
  • Muon optimizer: ускоренная сходимость обучения.
Три hard numbers (vendor): на 1M контекста V4-Pro требует 27 % FLOPs и 10 % KV cache от V3.2. Artificial Analysis Intelligence Index для V4-Flash-0731: 50 при $0,03 за задачу — Kimi K3: 57 / $0,86; GPT-5.6 Sol и Claude Fable 5 на 9+ пунктов выше, но $1,86 и $3,15 за задачу.
МодельСтатусПараметрыInput (miss/hit)OutputЛицензия
V4-Flash-0731Official (31.07)284B / 13B$0,14 / $0,0028$0,28MIT
V4-ProТолько preview1,6T / 49B$0,435 / $0,003625$0,87MIT
Kimi K3Веса 27.072,8T / ~104B$3,00 / $0,30$15,00Custom
Qwen3.8-MaxAPI GA 03.082,4T / 95B$2,00 / ~$0,20$6,00Weights pending
Claude Opus 4.8ClosedNDA$5,00$25,00API only

03Harness: первый in-house agent framework DeepSeek

Changelog от 31 июля впервые называет DeepSeek Harness — in-house framework для file I/O, tool calls и multi-step engineering tasks, позиционируется против Claude Code. До этого DeepSeek опирался на сторонние harness.

Все опубликованные agent scores (Terminal Bench 2.0, Toolathlon) сняты в minimal mode Harness (max reasoning, top_p 0,95, temperature 1,0). DeepSeek предупреждает: «benchmarks extremely harness-sensitive». Пока Harness не public и не воспроизведён независимо — читайте цифры как vendor + specific framework, не portable capability.

04Comparison matrix: китайский open source vs frontier

МодельLabIntelligence Index (AA)Cost/task (AA)Terminal Bench 2.0
V4-Flash-0731DeepSeek50$0,0382,7 (Harness, vendor)
Kimi K3Moonshot57$0,86vendor-run
GLM-5.2Zhipu~+1 pt vs Flashn/an/a
GPT-5.6 SolOpenAI9+ pts above$1,86n/a
Claude Fable 5Anthropic9+ pts above$3,15n/a
V4-Pro PreviewDeepSeekn/an/a67,9 (vendor)

Парадокс: на независимом index Flash уступает Kimi K3 и GLM-5.2, но доминирует по cost per task — ~1/29 от K3, 1/62 от GPT-5.6 Sol, 1/105 от Fable 5. Отсюда семь недель #1 на OpenRouter: volume agents, не leaderboard chase. Срез цен Luna (−80 %) OpenAI — ответ на ту же kill-line динамику.

05Споры: kill line, Liang Wenfeng и слухи

  • Harness dependency: 82,7 vs 67,9 framework-bound; репродукция на Claude Code/Cursor pending.
  • Cache & stability: низкий input cache-hit, safety classifier timeouts (21st Century Business Herald).
  • Дата V4-Pro: «10–20 августа» из неподтверждённых источников; официально «как можно скорее».
  • Funding: слухи ~$7,4B (Tencent, NetEase) и IPO без regulatory filing.
  • Kill line (斩杀线): метафора китайского dev-сообщества — «достаточный IQ + дно цены» как bar выживания.
  • Community sentiment: до релиза прозвище «Liang Baikai» (пустые обещания); после 0731 — «Liang Sheng».

31 июля Nvidia, Broadcom и AMD почти не двинулись — контраст с R1-shock начала 2025. Рынок воспринимает DeepSeek-efficiency как норму китайской инженерии.

066-шаговый runbook: миграция и выбор модели

  1. 01
    Legacy audit: grep по deepseek-chat / deepseek-reasoner; оставить только deepseek-v4-flash или deepseek-v4-pro.
  2. 02
    Проверить build 0731: в staging подтвердить, что API и changelog указывают на official build.
  3. 03
    Routing policy: FAQ, classification, bulk — Flash ($0,28/M output); heavy reasoning — preview V4-Pro или frontier.
  4. 04
    Cache strategy: включить prompt cache; target 80 %+ hits — иначе miss input ($0,14/M) съедает экономию.
  5. 05
    Тест на своём harness: мерить на Cursor, Claude Code или своём pipeline — не копировать vendor numbers.
  6. 06
    Deploy CI host: long-running agent sessions требуют stable SSH и dedicated IO. На странице цен оценить NUKCLOUD bare-metal Mac nodes; shared pools могут съесть API savings через queue latency.

07Итог и FAQ

V4-Flash-0731 доказывает: post-training и pricing в 2026 важнее чистого scaling. Для volume agent pipelines Flash — rational choice; для max reasoning depth frontier впереди — кратно дороже.

Команды с V4-agents на больших репозиториях нуждаются в стабильном dev/CI layer. Shared minute pools, desktop Macs и oversubscribed VPS дают bandwidth jitter, neighbor CPU contention и обрывы long-lived connections — friction, которая быстро съедает cent-per-token savings. Для production agent hosts NUKCLOUD multi-region bare-metal / cloud Mac nodes дают dedicated Apple Silicon с чёткими tenant boundaries. Сравните на странице цен и протестируйте через заказ — см. также ds4 runbook для MIT self-hosting.

Чем V4-Flash-0731 отличается от апрельского preview?
Та же 284B/13B; прирост только post-training. Endpoint deepseek-v4-flash с 31 июля на build 0731.
Когда выйдут официальный V4-Pro и Harness?
На 5 августа 2026 даты нет. DeepSeek: «как можно скорее». Окно 10–20 августа — неподтверждённый слух.
Можно ли доверять agent-бенчмаркам?
Terminal Bench 82,7 на unreleased Harness. SWE-bench Verified надёжнее. Ждите independent reproduction.
Flash vs Claude Opus 4.8 по цене?
Китайские медиа: input miss ~36×, cache-hit ~179×, output ~89× дешевле. Vendor list prices, без аудита.
Flash или Pro для agent pipelines?
Volume/batch — Flash. Heavy reasoning с бюджетом — preview V4-Pro. Frontier — без cost ceiling.

Данные на 2026-08-05. Источники: DeepSeek API docs/changelog, arXiv V4 report, Hugging Face, Artificial Analysis, 21st Century Business Herald, OpenRouter.