一句话结论: DeepSeek V4 GA 以 MIT 开源 + 1M token 上下文 + SWE-bench Verified 80.6% 开源纪录,在闭源旗舰约 1/10 乃至 1/100 的成本下提供开源模型最强性能。本文从时间线、技术架构(CSA/HCA/mHC/Muon)、Benchmark 跑分、对标 GPT-5.6 / Claude Fable 5、峰谷计费、7月24日 API 迁移六个维度完整解读,并附六步 Runbook 与 FAQ。若需本地私有部署,可对照本站 ds4 高内存 Mac 云端推理指南。
00DeepSeek V4 满血版是什么?
DeepSeek V4 满血版(GA,General Availability)是 DeepSeek 于 2026 年 7 月 20 日正式上线的生产级大模型家族,包含 V4-Pro(1.6T 参数) 与 V4-Flash(284B 参数) 两个规格,均以 MIT 协议开源,支持 100 万 token 上下文与最高 384K token 输出。
相比 4 月预览版,GA 版本在 Agent 任务、数学推理与代码生成上做了专项提升,并配套正式的商业化计费体系——峰谷差异化定价。旧接口名 deepseek-chat 与 deepseek-reasoner 将于 7 月 24 日永久下线。
- 开源可自托管:MIT 协议,企业可私有部署满足数据出境合规。
- 1M 上下文实测可用:KV Cache 内存仅为 V3.2 的 10%(Flash 低至 7%)。
- 开源 SWE-bench 纪录:Verified 80.6%,与 Gemini 3.1 Pro 并列开源最高。
- 极致 API 性价比:V4-Pro 输出平时 $0.87/M,高峰 $1.74/M,约为 Claude Fable 5 的 1/57。
01时间线:从预览版到满血版
| 时间 | 事件 |
|---|---|
| 2026-04-24 | V4 预览版上线 + 开源(MIT),含 V4-Pro(1.6T)与 V4-Flash(284B) |
| 2026-05 | 生产调优版本上线,API 正式可用 |
| 2026-06 | V4-Pro 价格永久降价 75%(输出 $0.87/M tokens) |
| 2026-06-29 | 向全体 API 用户发邮件,宣布 GA 将于 7 月中旬上线,首次披露峰谷计费 |
| 2026-07-19 | 多位开发者获 GA 灰度内测资格,媒体称「满血版最快明日发布」 |
| 2026-07-20 | GA 正式版上线(本文发布日) |
| 2026-07-24 | 旧接口 deepseek-chat / deepseek-reasoner 永久下线 |
02技术架构深度解析
模型家族一览
| 规格 | V4-Pro | V4-Flash |
|---|---|---|
| 总参数量 | 1.6 万亿(1.6T) | 2840 亿(284B) |
| 每 Token 激活参数 | 490 亿(49B) | 130 亿(13B) |
| Transformer 层数 | 61 层 | 43 层 |
| 上下文窗口 | 1,000,000 tokens | 1,000,000 tokens |
| 最大输出 | 384K tokens | 384K tokens |
| 精度 | FP4(专家权重)+ FP8(其余) | FP4 + FP8 混合 |
| 预训练数据量 | 33T+ tokens | 32T+ tokens |
| 开源协议 | MIT | MIT |
混合注意力机制(CSA + HCA)
DeepSeek V4 抛弃 V2/V3 时代的 MLA,采用两种全新注意力机制的混合体:
压缩稀疏注意力(CSA):KV 序列经 Softmax 门控池化压缩 4 倍,再用 FP4「闪电索引器」做 top-k 稀疏选择(Pro 选 top-1024,Flash 选 top-512),同时保留最近 128 token 滑动窗口。1M 上下文下相比 V3.2 仅需 27% 推理 FLOPs。
重度压缩注意力(HCA):将 token 压缩 128 倍后做全局密集注意力,捕获长程依赖。Flash 前 2 层用 HCA,之后 CSA/HCA 交替;Pro 结构类似。
综合效果:1M token 场景下 KV Cache 内存仅为 V3.2 的 10%(Flash 低至 7%)。
流形约束超连接(mHC)与 Muon 优化器
mHC 升级传统残差连接,引入 4 通道残差流与双随机矩阵约束(Birkhoff 多面体),确保 61 层深网络中信号稳定传播。Muon 优化器通过牛顿-舒尔兹正交化处理梯度,收敛更快、训练更稳定。
三种推理模式
| 模式 | 特点 | 适用场景 |
|---|---|---|
| Non-think | 无思维链,极速响应 | 简单问答、路由分发 |
| Think High | 显式推理(<redacted_thinking> 标签) | 中等复杂任务、代码调试 |
| Think Max | 最大推理力度,需 384K+ 上下文 | 复杂数学、长链路 Agent |
官方推荐采样参数:temperature=1.0, top_p=1.0(全模式通用)。
03Benchmark 跑分:开源之王的成绩单
| 基准测试 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(开源最高) | 96.0% | 未单独公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified 是「真实 GitHub 仓库 Bug 修复」测试,80.6% 为当前开源模型最高分。SWE-bench Pro 更严格,Claude Fable 5 以 80.3% 领先。
性价比横向对比
Artificial Analysis 评测数据(Strategy & Ops 指数任务):
- Claude Fable 5:每次 $3.48,得分 50 分
- DeepSeek V4-Pro:每次 $0.03,得分 38 分
- DeepSeek V4-Flash:六类指数任务每次均低于 $0.04
Fable 5 成本是 V4-Pro 的 116 倍,得分仅高出约 12 分(31%)。对照 Kimi K3 评测:K3 参数更大但 API 输出 $15/M,V4-Pro 在成本敏感场景仍具压倒优势。
04与 GPT-5.6 / Claude Fable 5 全面对比
| 维度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 开源 | MIT 协议 | 闭源 | 闭源 |
| 可自托管 | 支持 | 不支持 | 不支持 |
| 上下文窗口 | 1M tokens | 未公开 | 1M tokens |
| 代码能力 | 极强(接近 Fable 5) | 极强 | 最强 |
| API 输出价(平时) | $0.87/M tokens | ~$15/M | $50/M |
| 峰值输出价 | $1.74/M tokens | — | — |
| Agent 能力 | 强,支持多 Agent 编排 | 强 | 最强 |
| 数据隐私 | 可私有部署 | 不支持 | 不支持 |
选型建议:
- 预算有限 / 高频调用 / 私有部署:首选 V4-Pro 或 V4-Flash
- 极致代码能力、不在乎成本:Claude Fable 5(SWE-bench Pro 最高分)
- 复杂算法 + 数学推理:GPT-5.6 Sol / Ultra
- 超大规模日志/文档处理:V4-Flash(缓存命中输入仅 $0.0028/M)
05峰谷计费详解:该怎么省钱?
GA 版本最受关注的变化:DeepSeek 首次引入峰谷差异化定价,类似电网分时电价。高峰时段(北京时间):工作日 09:00–12:00 和 14:00–18:00,费率翻倍。
| 模型 | 计费项 | 平时(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 输入(缓存命中) | ¥0.025 / $0.0035 / 1M | 翻倍 |
| 输入(缓存未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 输出 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 输入(缓存命中) | ¥0.02 / $0.0028 / 1M | 翻倍 |
| 输入(缓存未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 输出 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
省钱四策:
- 非实时任务排到非高峰(18:00 后或 9:00 前)
- 善用 Prompt Cache,V4-Flash 缓存命中仅 $0.0028/M
- Flash 做分流:简单路由用 Flash,复杂推理转 Pro
- 关注计费变更邮件(DeepSeek 承诺 24 小时前通知)
即使高峰期,V4-Pro 输出 $1.74/M 仍比 Claude Opus 4.8($15/M)便宜 8.6 倍。
06API 迁移指南(7月24日截止)
deepseek-chat 和 deepseek-reasoner 将于 2026年7月24日 15:59 UTC(北京时间 23:59) 永久停止访问。| 旧模型名 | 新模型名 | 备注 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考模式) | 速度快,适合轻量任务 |
deepseek-reasoner | deepseek-v4-flash(思考模式) | 或升级 deepseek-v4-pro 获取更强推理 |
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
)
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
V4 同时支持 OpenAI ChatCompletions 与 Anthropic Messages 格式,base_url 不变,仅需更新 model 参数。
07六步 Runbook:V4 GA 生产接入
-
01
审计代码库:全局搜索
deepseek-chat与deepseek-reasoner,列出所有调用点与环境变量。 -
02
选择目标模型:轻量对话走
deepseek-v4-flash;复杂 Agent/代码走deepseek-v4-pro;思考模式用extra_body启用。 -
03
Staging 冒烟测试:在 7 月 24 日前于预发环境验证 Non-think / Think High / Think Max 三模式输出质量。
-
04
配置峰谷调度:批量文档处理、代码审查等离线任务 cron 到 18:00 后或周末,缓存命中目标 80%+。
-
05
建立 Flash→Pro 路由:意图分类与 FAQ 走 Flash($0.28/M 输出),复杂推理再 escalate 到 Pro。
-
06
部署 Agent 宿主:长时 V4 Agent 会话需要稳定 SSH 与无邻居争抢算力。对照 定价页 评估 NUKCLOUD 独占 Mac 节点作为 CI 与 Agent 构建平面,避免共享池尾延迟吞噬 API 成本优势。
08总结与 FAQ
DeepSeek V4 GA 是 2026 年开源大模型领域最重要的里程碑之一。其价值不在于能否击败 Claude Fable 5 或 GPT-5.6(暂时还不能),而在于以闭源旗舰 1/10 乃至 1/100 的成本,提供开源模型中无可争议的最强性能。峰谷计费增加了成本复杂度,但本质上仍极具竞争力——DeepSeek 从「价格屠夫」到「有规则的商业平台」的转型,是成熟化信号。
团队用 V4 驱动长时 Agent 对大型代码库调用时,仍需要稳定、可审计的本地开发与 CI 平面。共享分钟池、桌下 Mac 或超卖 VPS 上的宽带抖动、邻居 CPU 争抢与长连接中断,会迅速吃掉 Token 降价带来的收益。对更稳定的生产 Agent 主机,NUKCLOUD 多区域裸金属 Mac / 云端 Mac 节点提供独占 Apple Silicon 算力与清晰租户边界,可在 定价页 对照规格并经 下单页 试跑。
deepseek-v4-flash 或 deepseek-v4-pro。数据截至 2026-07-20。来源:DeepSeek 官方文档、arXiv:2606.19348、HuggingFace 模型页、LLMReference、Artificial Analysis、MangoMind Blog。