DeepSeek V4 GA: полный релиз — цены, архитектура и разрыв с GPT-5.6

Три месяца preview закончились: 20 июля 2026 DeepSeek V4 вышел в GA — усиленные agent-capabilities и впервые пиково-внепиковое ценообразование. Это переход от «почти бесплатного» эксперимента к дисциплинированной коммерческой платформе.

Вывод в одном абзаце: DeepSeek V4 GA сочетает MIT open weights, контекст 1M токенов и рекорд SWE-bench Verified 80,6% при стоимости примерно 1/10–1/100 от закрытых флагманов. Ниже — таймлайн, архитектура CSA/HCA/mHC/Muon, таблицы бенчмарков, сравнение с GPT-5.6 и Claude Fable 5, пиково-внепиковые тарифы и миграция API до 24 июля — плюс шестишаговый runbook и FAQ. Для приватного деплоя см. runbook ds4: локальный инференс на Mac с большим объёмом памяти.

00Что такое DeepSeek V4 GA

DeepSeek V4 GA (General Availability) — production-grade семейство моделей, вышедшее 20 июля 2026. Включает V4-Pro (1,6T параметров) и V4-Flash (284B параметров), оба под MIT, с контекстом 1 000 000 токенов и максимальным выходом до 384K токенов на запрос.

Относительно preview апреля GA получил целевые улучшения в agent-задачах, математическом рассуждении и генерации кода, а также формальный коммерческий биллинг — пиково-внепиковое дифференцированное ценообразование. Устаревшие endpoint-имена deepseek-chat и deepseek-reasoner навсегда отключаются 24 июля.

  • Self-host под MIT: приватный деплой для data sovereignty и трансграничного compliance.
  • 1M контекст в production: KV-cache занимает 10% от V3.2 (на Flash — 7%).
  • Рекорд open-source SWE-bench: Verified 80,6%, на уровне Gemini 3.1 Pro среди открытых моделей.
  • Лидер API по цене/качеству: V4-Pro output $0,87/M вне пика, $1,74/M в пик — примерно 1/57 от Claude Fable 5.

01Таймлайн: от preview к полному релизу

ДатаСобытие
2026-04-24Preview V4 + open weights (MIT): V4-Pro (1,6T) и V4-Flash (284B)
2026-05Production-tuned build, API в общем доступе
2026-06Постоянное снижение цены V4-Pro на 75% (output $0,87/M tokens)
2026-06-29Email всем API-пользователям: GA в середине июля, первое раскрытие пиково-внепикового биллинга
2026-07-19Gray-scale GA у ряда разработчиков; СМИ: «полный релиз — завтра»
2026-07-20GA в production (дата публикации)
2026-07-24Legacy endpoint deepseek-chat / deepseek-reasoner отключаются навсегда
Ключевой сдвиг: preview уже был силён; GA добавляет agent/math/code gains, пиково-внепиковый биллинг и жёсткий sunset legacy API. Контекст скидки 75% в июне — в обзоре AI-скидок июня.

02Архитектура: технический разбор

Семейство моделей

ПараметрV4-ProV4-Flash
Всего параметров1,6 трлн (1,6T)284 млрд (284B)
Активных на токен49 млрд (49B)13 млрд (13B)
Слоёв Transformer6143
Контекстное окно1 000 000 токенов1 000 000 токенов
Макс. выход384K токенов384K токенов
ТочностьFP4 (веса экспертов) + FP8 (остальное)FP4 + FP8 mixed
Pretrain corpus33T+ токенов32T+ токенов
ЛицензияMITMIT

Гибридное внимание: CSA + HCA

DeepSeek V4 отказался от MLA эпохи V2/V3 в пользу двух новых механизмов attention:

Compressed Sparse Attention (CSA): KV-последовательность сжимается в 4 раза через Softmax-gated pooling, затем FP4 «lightning indexer» выполняет top-k sparse selection (Pro: top-1024, Flash: top-512) с сохранением sliding window последних 128 токенов. На 1M контексте — 27% inference FLOPs относительно V3.2.

Heavily Compressed Attention (HCA): токены сжимаются в 128 раз, затем глобальное dense attention для long-range dependencies. Flash: первые 2 слоя — HCA, далее чередование CSA/HCA; у Pro аналогичная схема.

Суммарный эффект: KV-cache на 1M токенов — 10% от V3.2 (Flash — 7%).

Manifold-Constrained Hyper-Connections (mHC) и оптимизатор Muon

mHC эволюционирует классические residual connections: 4-канальный residual stream с ограничением doubly stochastic matrix (многообразие Биркгофа) — стабильная передача сигнала через 61 слой. Muon ортогонализует градиенты через итерации Ньютона–Шульца — быстрее сходимость и стабильнее training.

Три режима инференса

РежимПоведениеСценарий
Non-thinkБез chain-of-thought, минимальная latencyПростые Q&A, routing
Think HighЯвное рассуждение (тег <redacted_thinking>)Средняя сложность, отладка кода
Think MaxМаксимальная глубина reasoning, нужен контекст 384K+Сложная математика, длинные agent chains

Официальные sampling defaults: temperature=1.0, top_p=1.0 (все режимы).

03Бенчмарки: open-source лидер

БенчмаркDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6% (макс. open)96,0%не опубликовано отдельно~69%
SWE-bench Pro55,4%80,3%78,1%69,2%
LiveCodeBench (Pass@1)93,5%88,1%87,4%83,2%
Codeforces Elo3 206
Terminal-Bench 2.183,9%88,0%85,1%82,7%

SWE-bench Verified — реальные bugfix в GitHub-репозиториях; 80,6% — лучший результат среди open weights. SWE-bench Pro строже: Fable 5 лидирует с 80,3%.

Цена/качество: горизонтальное сравнение

Данные Artificial Analysis (Strategy & Ops index tasks):

  • Claude Fable 5: $3,48 за прогон, score 50
  • DeepSeek V4-Pro: $0,03 за прогон, score 38
  • DeepSeek V4-Flash: ниже $0,04 за прогон на шести классах index tasks

Fable 5 дороже V4-Pro в 116 раз, score выше лишь на ~12 пунктов (31%). Сравнение с Kimi K3: K3 крупнее по параметрам, но API output $15/M — V4-Pro сохраняет подавляющее преимущество в cost-sensitive сценариях.

04Сравнение с GPT-5.6 и Claude Fable 5

ИзмерениеDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open weightsMITЗакрытаяЗакрытая
Self-hostДаНетНет
Контекст1M токеновне раскрыт1M токенов
КодОчень сильный (близко к Fable 5)Очень сильныйМаксимальный
API output (вне пика)$0,87/M tokens~$15/M$50/M
API output (пик)$1,74/M tokens
Agent orchestrationСильный, multi-agentСильныйМаксимальный
Data privacyПриватный деплойНетНет

Матрица выбора:

  • Ограниченный бюджет / высокочастотный API / self-host: V4-Pro или V4-Flash
  • Максимум code quality, бюджет вторичен: Claude Fable 5 (лидер SWE-bench Pro)
  • Сложные алгоритмы и математика: GPT-5.6 Sol / Ultra
  • Массовая обработка логов и документов: V4-Flash (cache hit input от $0,0028/M)

05Пиково-внепиковый биллинг: как снизить расход

Главное нововведение GA: дифференцированное ценообразование по времени суток — аналог тарифов на электроэнергию. Пик (пекинское время, будни): 09:00–12:00 и 14:00–18:00 — ставки удваиваются.

МодельСтатьяВне пика (Off-Peak)Пик (Peak)
V4-ProInput (cache hit)¥0,025 / $0,0035 / 1M×2
Input (cache miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
Output¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashInput (cache hit)¥0,02 / $0,0028 / 1M×2
Input (cache miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
Output¥2,00 / $0,28 / 1M¥4,00 / $0,56

Четыре тактики экономии:

  1. Несрочные batch-job — вне пика (после 18:00 или до 09:00)
  2. Агрессивный Prompt Cache: V4-Flash cache hit — $0,0028/M input
  3. Flash→Pro routing: простой intent на Flash, сложный reasoning — escalate на Pro
  4. Мониторинг email от DeepSeek (обещают уведомление за 24 ч до изменения тарифов)

Даже в пик V4-Pro output $1,74/M дешевле Claude Opus 4.8 ($15/M) в 8,6 раз.

06Миграция API (дедлайн 24 июля)

Критично: legacy model ID deepseek-chat и deepseek-reasoner перестают отвечать 24 июля 2026 в 15:59 UTC (23:59 по Пекину).
Legacy modelНовый model IDПримечание
deepseek-chatdeepseek-v4-flash (non-think)Низкая latency, лёгкие задачи
deepseek-reasonerdeepseek-v4-flash (think mode)Или deepseek-v4-pro для более сильного reasoning
Python OpenAI SDK
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
)
Anthropic SDK (совместимый endpoint)
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

V4 поддерживает OpenAI ChatCompletions и Anthropic Messages; base_url не меняется — обновите только model.

07Шестишаговый runbook: V4 GA в production

  1. 01
    Аудит кодовой базы: глобальный поиск deepseek-chat и deepseek-reasoner — все call site и env vars.
  2. 02
    Выбор target model: лёгкий диалог — deepseek-v4-flash; сложный agent/code — deepseek-v4-pro; think mode через extra_body.
  3. 03
    Staging smoke test: до 24 июля проверить Non-think / Think High / Think Max в pre-prod на качество выхода.
  4. 04
    Пиково-внепиковый scheduler: batch document processing, code review — cron после 18:00 или в выходные; цель cache hit 80%+.
  5. 05
    Flash→Pro routing layer: intent classification и FAQ на Flash ($0,28/M output), сложный reasoning — escalate на Pro.
  6. 06
    Agent host: долгие V4-agent сессии требуют стабильного SSH и выделенного compute без oversubscription. Оцените выделенные Mac-ноды NUKCLOUD как CI и agent build plane на странице цен — tail latency shared pool съедает экономию от API.

08Итог и FAQ

DeepSeek V4 GA — один из ключевых рубежей open-source LLM в 2026. Ценность не в том, обгонит ли он Claude Fable 5 или GPT-5.6 (пока нет), а в том, что при 1/10–1/100 стоимости закрытых флагманов он даёт лучшую производительность среди open weights. Пиково-внепиковый биллинг усложняет cost model, но абсолютные тарифы остаются агрессивными — переход DeepSeek от «ценового демпинга» к дисциплинированной коммерческой платформе сигнализирует зрелость.

Команды, гоняющие V4-agent по крупным codebases, всё равно нуждаются в стабильной, аудируемой dev/CI плоскости. Shared minute pools, домашний Mac или oversubscribed VPS дают bandwidth jitter, neighbor CPU contention и обрывы long-lived connections — token savings испаряются на retry. Для production agent host мультирегиональные bare-metal Mac / облачные Mac-ноды NUKCLOUD обеспечивают выделенный Apple Silicon и чёткие tenant boundaries — сравните spec на ценах и trial на заказе.

Чем GA-версия DeepSeek V4 отличается от preview?
GA добавляет целевые улучшения в agent, math reasoning и code generation, впервые вводит пиково-внепиковый биллинг. Базовая MoE 1,6T не изменилась; production-стабильность и коммерческая система готовы.
Когда действуют пиковые тарифы?
По пекинскому времени в будни: 09:00–12:00 и 14:00–18:00 — ставки ×2. Batch-задачи планируйте после 18:00.
Когда отключается deepseek-chat?
24 июля 2026, 15:59 UTC (23:59 по Пекину). Мигрируйте на deepseek-v4-flash или deepseek-v4-pro.
Можно ли развернуть DeepSeek V4 локально?
Да, MIT. На Apple Silicon с большим объёмом памяти — Flash variant; см. runbook ds4.
DeepSeek V4 или GPT-5.6 — что выгоднее?
V4-Pro output: $0,87/M вне пика, $1,74/M в пик — ~1/17 от GPT-5.6 Sol (~$15/M). Рекорд open-source SWE-bench Verified — 80,6%.
На какой инфраструктуре гонять Agent CI?
Долгие V4-agent сессии требуют стабильного SSH, предсказуемого disk IO и отсутствия neighbor contention. Выделенные Mac-ноды NUKCLOUD — agent host и CI build plane.

Данные на 2026-07-20. Источники: документация DeepSeek, arXiv:2606.19348, HuggingFace model cards, LLMReference, Artificial Analysis, MangoMind Blog.