Тезис: После гайда V4 GA и API-миграции 24 июля build 0731 даёт более зрелую вариацию — не новую модель. Ниже: таймлайн, таблица цен, контекст Harness, матрица vs Kimi K3 и Qwen3.8-Max, споры, «линия уничтожения», 6-шаговый runbook и FAQ — с рекомендацией NUKCLOUD для стабильной agent-CI.
00Почему V4-Flash-0731 важен сейчас
V4-Flash-0731 — не новый foundation model, а тот же MoE 284B / 13B active, что в апреле, с перезапуском post-training. DeepSeek заявляет, что agent-бенчмарки обходят preview V4-Pro 1,6T — ломая аксиому «больше = лучше».
- Ценовой пресс: output $0,28/M против $25/M у Opus 4.8 — до 89× дешевле по китайским медиа; input cache-hit $0,0028/M.
- Harness-dependency: Terminal Bench 2.0 82,7 vs preview V4-Pro 67,9 — на неопубликованном agent framework.
- Open-конкуренция: Kimi K3 (27 июля), Qwen3.8-Max (3 августа) и GLM-5.2 давят DeepSeek в логику «kill line».
- Pro в ожидании: официальный V4-Pro и Harness — «скоро»; окно GA 10–20 августа не подтверждено.
- Production friction: dev-сообщество сообщает о низком cache-hit и timeout safety classifier.
01Таймлайн: от апрельского preview до августа 2026
| Дата | Событие |
|---|---|
| 2026-04-24 | Preview V4 + open weights (MIT): V4-Pro 1,6T/49B, V4-Flash 284B/13B, контекст 1M |
| 2026-07-20 | GA V4 с peak-valley pricing — см. статью GA |
| 2026-07-24 | Отключены deepseek-chat / deepseek-reasoner; трафик на семейство V4 |
| 2026-07-27 | Moonshot публикует веса Kimi K3 на Hugging Face (2,8T) |
| 2026-07-31 | V4-Flash-0731 официальная API beta; веса MIT; первое упоминание Harness; только API |
| 2026-08-05 | Официальный V4-Pro и Harness без подтверждённой даты (дата публикации) |
02Архитектура без изменений — post-training решает
Техотчёт DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence сохраняет три элемента preview:
- CSA + HCA: гибридное attention снижает FLOPs и KV cache на 1M токенов.
- mHC: manifold-constrained hyper-connections стабилизируют deep residual paths.
- Muon optimizer: ускоренная сходимость обучения.
| Модель | Статус | Параметры | Input (miss/hit) | Output | Лицензия |
|---|---|---|---|---|---|
| V4-Flash-0731 | Official (31.07) | 284B / 13B | $0,14 / $0,0028 | $0,28 | MIT |
| V4-Pro | Только preview | 1,6T / 49B | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Веса 27.07 | 2,8T / ~104B | $3,00 / $0,30 | $15,00 | Custom |
| Qwen3.8-Max | API GA 03.08 | 2,4T / 95B | $2,00 / ~$0,20 | $6,00 | Weights pending |
| Claude Opus 4.8 | Closed | NDA | $5,00 | $25,00 | API only |
03Harness: первый in-house agent framework DeepSeek
Changelog от 31 июля впервые называет DeepSeek Harness — in-house framework для file I/O, tool calls и multi-step engineering tasks, позиционируется против Claude Code. До этого DeepSeek опирался на сторонние harness.
Все опубликованные agent scores (Terminal Bench 2.0, Toolathlon) сняты в minimal mode Harness (max reasoning, top_p 0,95, temperature 1,0). DeepSeek предупреждает: «benchmarks extremely harness-sensitive». Пока Harness не public и не воспроизведён независимо — читайте цифры как vendor + specific framework, не portable capability.
04Comparison matrix: китайский open source vs frontier
| Модель | Lab | Intelligence Index (AA) | Cost/task (AA) | Terminal Bench 2.0 |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0,03 | 82,7 (Harness, vendor) |
| Kimi K3 | Moonshot | 57 | $0,86 | vendor-run |
| GLM-5.2 | Zhipu | ~+1 pt vs Flash | n/a | n/a |
| GPT-5.6 Sol | OpenAI | 9+ pts above | $1,86 | n/a |
| Claude Fable 5 | Anthropic | 9+ pts above | $3,15 | n/a |
| V4-Pro Preview | DeepSeek | n/a | n/a | 67,9 (vendor) |
Парадокс: на независимом index Flash уступает Kimi K3 и GLM-5.2, но доминирует по cost per task — ~1/29 от K3, 1/62 от GPT-5.6 Sol, 1/105 от Fable 5. Отсюда семь недель #1 на OpenRouter: volume agents, не leaderboard chase. Срез цен Luna (−80 %) OpenAI — ответ на ту же kill-line динамику.
05Споры: kill line, Liang Wenfeng и слухи
- Harness dependency: 82,7 vs 67,9 framework-bound; репродукция на Claude Code/Cursor pending.
- Cache & stability: низкий input cache-hit, safety classifier timeouts (21st Century Business Herald).
- Дата V4-Pro: «10–20 августа» из неподтверждённых источников; официально «как можно скорее».
- Funding: слухи ~$7,4B (Tencent, NetEase) и IPO без regulatory filing.
- Kill line (斩杀线): метафора китайского dev-сообщества — «достаточный IQ + дно цены» как bar выживания.
- Community sentiment: до релиза прозвище «Liang Baikai» (пустые обещания); после 0731 — «Liang Sheng».
31 июля Nvidia, Broadcom и AMD почти не двинулись — контраст с R1-shock начала 2025. Рынок воспринимает DeepSeek-efficiency как норму китайской инженерии.
066-шаговый runbook: миграция и выбор модели
-
01
Legacy audit: grep по
deepseek-chat/deepseek-reasoner; оставить толькоdeepseek-v4-flashилиdeepseek-v4-pro. -
02
Проверить build 0731: в staging подтвердить, что API и changelog указывают на official build.
-
03
Routing policy: FAQ, classification, bulk — Flash ($0,28/M output); heavy reasoning — preview V4-Pro или frontier.
-
04
Cache strategy: включить prompt cache; target 80 %+ hits — иначе miss input ($0,14/M) съедает экономию.
-
05
Тест на своём harness: мерить на Cursor, Claude Code или своём pipeline — не копировать vendor numbers.
-
06
Deploy CI host: long-running agent sessions требуют stable SSH и dedicated IO. На странице цен оценить NUKCLOUD bare-metal Mac nodes; shared pools могут съесть API savings через queue latency.
07Итог и FAQ
V4-Flash-0731 доказывает: post-training и pricing в 2026 важнее чистого scaling. Для volume agent pipelines Flash — rational choice; для max reasoning depth frontier впереди — кратно дороже.
Команды с V4-agents на больших репозиториях нуждаются в стабильном dev/CI layer. Shared minute pools, desktop Macs и oversubscribed VPS дают bandwidth jitter, neighbor CPU contention и обрывы long-lived connections — friction, которая быстро съедает cent-per-token savings. Для production agent hosts NUKCLOUD multi-region bare-metal / cloud Mac nodes дают dedicated Apple Silicon с чёткими tenant boundaries. Сравните на странице цен и протестируйте через заказ — см. также ds4 runbook для MIT self-hosting.
deepseek-v4-flash с 31 июля на build 0731.Данные на 2026-08-05. Источники: DeepSeek API docs/changelog, arXiv V4 report, Hugging Face, Artificial Analysis, 21st Century Business Herald, OpenRouter.