Вывод в одном абзаце: DeepSeek V4 GA сочетает MIT open weights, контекст 1M токенов и рекорд SWE-bench Verified 80,6% при стоимости примерно 1/10–1/100 от закрытых флагманов. Ниже — таймлайн, архитектура CSA/HCA/mHC/Muon, таблицы бенчмарков, сравнение с GPT-5.6 и Claude Fable 5, пиково-внепиковые тарифы и миграция API до 24 июля — плюс шестишаговый runbook и FAQ. Для приватного деплоя см. runbook ds4: локальный инференс на Mac с большим объёмом памяти.
00Что такое DeepSeek V4 GA
DeepSeek V4 GA (General Availability) — production-grade семейство моделей, вышедшее 20 июля 2026. Включает V4-Pro (1,6T параметров) и V4-Flash (284B параметров), оба под MIT, с контекстом 1 000 000 токенов и максимальным выходом до 384K токенов на запрос.
Относительно preview апреля GA получил целевые улучшения в agent-задачах, математическом рассуждении и генерации кода, а также формальный коммерческий биллинг — пиково-внепиковое дифференцированное ценообразование. Устаревшие endpoint-имена deepseek-chat и deepseek-reasoner навсегда отключаются 24 июля.
- Self-host под MIT: приватный деплой для data sovereignty и трансграничного compliance.
- 1M контекст в production: KV-cache занимает 10% от V3.2 (на Flash — 7%).
- Рекорд open-source SWE-bench: Verified 80,6%, на уровне Gemini 3.1 Pro среди открытых моделей.
- Лидер API по цене/качеству: V4-Pro output $0,87/M вне пика, $1,74/M в пик — примерно 1/57 от Claude Fable 5.
01Таймлайн: от preview к полному релизу
| Дата | Событие |
|---|---|
| 2026-04-24 | Preview V4 + open weights (MIT): V4-Pro (1,6T) и V4-Flash (284B) |
| 2026-05 | Production-tuned build, API в общем доступе |
| 2026-06 | Постоянное снижение цены V4-Pro на 75% (output $0,87/M tokens) |
| 2026-06-29 | Email всем API-пользователям: GA в середине июля, первое раскрытие пиково-внепикового биллинга |
| 2026-07-19 | Gray-scale GA у ряда разработчиков; СМИ: «полный релиз — завтра» |
| 2026-07-20 | GA в production (дата публикации) |
| 2026-07-24 | Legacy endpoint deepseek-chat / deepseek-reasoner отключаются навсегда |
02Архитектура: технический разбор
Семейство моделей
| Параметр | V4-Pro | V4-Flash |
|---|---|---|
| Всего параметров | 1,6 трлн (1,6T) | 284 млрд (284B) |
| Активных на токен | 49 млрд (49B) | 13 млрд (13B) |
| Слоёв Transformer | 61 | 43 |
| Контекстное окно | 1 000 000 токенов | 1 000 000 токенов |
| Макс. выход | 384K токенов | 384K токенов |
| Точность | FP4 (веса экспертов) + FP8 (остальное) | FP4 + FP8 mixed |
| Pretrain corpus | 33T+ токенов | 32T+ токенов |
| Лицензия | MIT | MIT |
Гибридное внимание: CSA + HCA
DeepSeek V4 отказался от MLA эпохи V2/V3 в пользу двух новых механизмов attention:
Compressed Sparse Attention (CSA): KV-последовательность сжимается в 4 раза через Softmax-gated pooling, затем FP4 «lightning indexer» выполняет top-k sparse selection (Pro: top-1024, Flash: top-512) с сохранением sliding window последних 128 токенов. На 1M контексте — 27% inference FLOPs относительно V3.2.
Heavily Compressed Attention (HCA): токены сжимаются в 128 раз, затем глобальное dense attention для long-range dependencies. Flash: первые 2 слоя — HCA, далее чередование CSA/HCA; у Pro аналогичная схема.
Суммарный эффект: KV-cache на 1M токенов — 10% от V3.2 (Flash — 7%).
Manifold-Constrained Hyper-Connections (mHC) и оптимизатор Muon
mHC эволюционирует классические residual connections: 4-канальный residual stream с ограничением doubly stochastic matrix (многообразие Биркгофа) — стабильная передача сигнала через 61 слой. Muon ортогонализует градиенты через итерации Ньютона–Шульца — быстрее сходимость и стабильнее training.
Три режима инференса
| Режим | Поведение | Сценарий |
|---|---|---|
| Non-think | Без chain-of-thought, минимальная latency | Простые Q&A, routing |
| Think High | Явное рассуждение (тег <redacted_thinking>) | Средняя сложность, отладка кода |
| Think Max | Максимальная глубина reasoning, нужен контекст 384K+ | Сложная математика, длинные agent chains |
Официальные sampling defaults: temperature=1.0, top_p=1.0 (все режимы).
03Бенчмарки: open-source лидер
| Бенчмарк | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6% (макс. open) | 96,0% | не опубликовано отдельно | ~69% |
| SWE-bench Pro | 55,4% | 80,3% | 78,1% | 69,2% |
| LiveCodeBench (Pass@1) | 93,5% | 88,1% | 87,4% | 83,2% |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9% | 88,0% | 85,1% | 82,7% |
SWE-bench Verified — реальные bugfix в GitHub-репозиториях; 80,6% — лучший результат среди open weights. SWE-bench Pro строже: Fable 5 лидирует с 80,3%.
Цена/качество: горизонтальное сравнение
Данные Artificial Analysis (Strategy & Ops index tasks):
- Claude Fable 5: $3,48 за прогон, score 50
- DeepSeek V4-Pro: $0,03 за прогон, score 38
- DeepSeek V4-Flash: ниже $0,04 за прогон на шести классах index tasks
Fable 5 дороже V4-Pro в 116 раз, score выше лишь на ~12 пунктов (31%). Сравнение с Kimi K3: K3 крупнее по параметрам, но API output $15/M — V4-Pro сохраняет подавляющее преимущество в cost-sensitive сценариях.
04Сравнение с GPT-5.6 и Claude Fable 5
| Измерение | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open weights | MIT | Закрытая | Закрытая |
| Self-host | Да | Нет | Нет |
| Контекст | 1M токенов | не раскрыт | 1M токенов |
| Код | Очень сильный (близко к Fable 5) | Очень сильный | Максимальный |
| API output (вне пика) | $0,87/M tokens | ~$15/M | $50/M |
| API output (пик) | $1,74/M tokens | — | — |
| Agent orchestration | Сильный, multi-agent | Сильный | Максимальный |
| Data privacy | Приватный деплой | Нет | Нет |
Матрица выбора:
- Ограниченный бюджет / высокочастотный API / self-host: V4-Pro или V4-Flash
- Максимум code quality, бюджет вторичен: Claude Fable 5 (лидер SWE-bench Pro)
- Сложные алгоритмы и математика: GPT-5.6 Sol / Ultra
- Массовая обработка логов и документов: V4-Flash (cache hit input от $0,0028/M)
05Пиково-внепиковый биллинг: как снизить расход
Главное нововведение GA: дифференцированное ценообразование по времени суток — аналог тарифов на электроэнергию. Пик (пекинское время, будни): 09:00–12:00 и 14:00–18:00 — ставки удваиваются.
| Модель | Статья | Вне пика (Off-Peak) | Пик (Peak) |
|---|---|---|---|
| V4-Pro | Input (cache hit) | ¥0,025 / $0,0035 / 1M | ×2 |
| Input (cache miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 | |
| Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 | |
| V4-Flash | Input (cache hit) | ¥0,02 / $0,0028 / 1M | ×2 |
| Input (cache miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 | |
| Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
Четыре тактики экономии:
- Несрочные batch-job — вне пика (после 18:00 или до 09:00)
- Агрессивный Prompt Cache: V4-Flash cache hit — $0,0028/M input
- Flash→Pro routing: простой intent на Flash, сложный reasoning — escalate на Pro
- Мониторинг email от DeepSeek (обещают уведомление за 24 ч до изменения тарифов)
Даже в пик V4-Pro output $1,74/M дешевле Claude Opus 4.8 ($15/M) в 8,6 раз.
06Миграция API (дедлайн 24 июля)
deepseek-chat и deepseek-reasoner перестают отвечать 24 июля 2026 в 15:59 UTC (23:59 по Пекину).| Legacy model | Новый model ID | Примечание |
|---|---|---|
deepseek-chat | deepseek-v4-flash (non-think) | Низкая latency, лёгкие задачи |
deepseek-reasoner | deepseek-v4-flash (think mode) | Или deepseek-v4-pro для более сильного reasoning |
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
)
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
V4 поддерживает OpenAI ChatCompletions и Anthropic Messages; base_url не меняется — обновите только model.
07Шестишаговый runbook: V4 GA в production
-
01
Аудит кодовой базы: глобальный поиск
deepseek-chatиdeepseek-reasoner— все call site и env vars. -
02
Выбор target model: лёгкий диалог —
deepseek-v4-flash; сложный agent/code —deepseek-v4-pro; think mode черезextra_body. -
03
Staging smoke test: до 24 июля проверить Non-think / Think High / Think Max в pre-prod на качество выхода.
-
04
Пиково-внепиковый scheduler: batch document processing, code review — cron после 18:00 или в выходные; цель cache hit 80%+.
-
05
Flash→Pro routing layer: intent classification и FAQ на Flash ($0,28/M output), сложный reasoning — escalate на Pro.
-
06
Agent host: долгие V4-agent сессии требуют стабильного SSH и выделенного compute без oversubscription. Оцените выделенные Mac-ноды NUKCLOUD как CI и agent build plane на странице цен — tail latency shared pool съедает экономию от API.
08Итог и FAQ
DeepSeek V4 GA — один из ключевых рубежей open-source LLM в 2026. Ценность не в том, обгонит ли он Claude Fable 5 или GPT-5.6 (пока нет), а в том, что при 1/10–1/100 стоимости закрытых флагманов он даёт лучшую производительность среди open weights. Пиково-внепиковый биллинг усложняет cost model, но абсолютные тарифы остаются агрессивными — переход DeepSeek от «ценового демпинга» к дисциплинированной коммерческой платформе сигнализирует зрелость.
Команды, гоняющие V4-agent по крупным codebases, всё равно нуждаются в стабильной, аудируемой dev/CI плоскости. Shared minute pools, домашний Mac или oversubscribed VPS дают bandwidth jitter, neighbor CPU contention и обрывы long-lived connections — token savings испаряются на retry. Для production agent host мультирегиональные bare-metal Mac / облачные Mac-ноды NUKCLOUD обеспечивают выделенный Apple Silicon и чёткие tenant boundaries — сравните spec на ценах и trial на заказе.
deepseek-v4-flash или deepseek-v4-pro.Данные на 2026-07-20. Источники: документация DeepSeek, arXiv:2606.19348, HuggingFace model cards, LLMReference, Artificial Analysis, MangoMind Blog.