DeepSeek V4 Flash 正式版上线:跑分逼近 Opus 4.8,价格却只要几十分之一,Pro 版还要再等等

7 月 31 日,DeepSeek 将 V4-Flash 升级为官方版:参数不变仅重训,跑分反超更大的 V4-Pro 预览版,价格只要 Claude Opus 4.8 的几十分之一;旗舰 V4-Pro 与自研 Agent 框架 Harness 仍处于「即将发布」状态,没有确切日期。

一句话结论: 这不是一次新模型发布,而是同一个 284B / 13B 激活 模型重新做了一遍后训练。V4-Flash-0731 在 Artificial Analysis 上 Intelligence Index 50、单任务成本 $0.03,跑分逼近闭源旗舰但价格仅为几十分之一。本文覆盖时间线、与 Kimi K3Qwen3.8-MaxGPT-5.6 降价 的横向对照、Harness 跑分争议、「斩杀线」价格战背景、六步 Runbook 与 FAQ,并链接 V4 满血版 GA 深度解析

00V4-Flash-0731 是什么?

DeepSeek V4-Flash-0731 是 2026 年 7 月 31 日进入 API 公测的官方正式版构建标签。总参数 2840 亿、每次推理激活 130 亿,与 4 月预览版架构完全相同——DeepSeek 官方明确说明性能提升「完全来自重新进行的后训练」,而非扩大模型规模。

规格数值
官方版日期2026 年 7 月 31 日(API 公测)
总参数 / 激活参数284B / 13B(与预览版相同)
上下文窗口1,000,000 tokens
输入定价(缓存未命中 / 命中)$0.14 / $0.0028 每百万 token
输出定价$0.28 每百万 token
协议MIT(权重已同步 Hugging Face)
接入范围仅限 API;App 与网页端暂未同步
V4-Pro 官方版未发布(截至 8 月 5 日)
Harness Agent 框架changelog 首次点名,尚未公开发布
硬核资料 #1: 284B 参数的 Flash 版在多项 Agent 基准上反超 1.6T 的 V4-Pro 预览版——Terminal Bench 2.0 官方报 82.7 vs V4-Pro 预览 67.9(均基于 Harness 极简模式,厂商自报)。

01时间线:从 4 月预览到 7 月「官方版」

  • 2026 年 4 月 24 日: DeepSeek-V4 预览版首次发布并开源,含 V4-Pro(1.6T / 49B 激活)与 V4-Flash(284B / 13B 激活),均支持 100 万 token 上下文,MIT 协议。
  • 2026 年 7 月 20 日: V4 满血版 GA 宣布,引入峰谷计费框架。
  • 2026 年 7 月 24 日: 旧接口 deepseek-chatdeepseek-reasoner 正式停用,全部流量切换到 V4 系列命名。
  • 2026 年 7 月 27 日: 月之暗面 Kimi K3(2.8T)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力。
  • 2026 年 7 月 31 日: V4-Flash-0731 正式版进入 API 公测,权重同步 Hugging Face;changelog 首次点名自研 Agent 框架「Harness」,称将随 V4 正式版一起发布。
  • 截至 2026 年 8 月 5 日: V4-Pro 官方版仍是「尽快发布」;有媒体援引未署名消息源称 8 月 10–20 日可能 GA——未经 DeepSeek 官方证实,仅供参考

痛点选型时容易被忽略的隐性成本

  • 跑分依赖 Harness: Agent 类跑分全部基于尚未公开发布的 Harness「极简模式」,官方自己提醒「跑分对 harness 选择非常敏感」,不能简单等同于模型本身能力。
  • 缓存命中率现实差距: $0.0028/M 的输入价依赖缓存命中;冷启动、轮换 system prompt、多租户路由常导致回退到 $0.14/M。
  • 海外开发者可用性问题: 据 21 世纪经济报道援引社区反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题。
  • 智能上限: Artificial Analysis 上 V4-Flash Intelligence Index 为 50,落后于 Kimi K3(57)和 GLM-5.2(高约 1 分);闭源旗舰仍高约 9 分以上。
  • V4-Pro 真空期: 等 1.6T 旗舰的团队没有官方 ship date;8 月 10–20 日为社区传言。
  • 融资传闻噪音: 媒体报道约 74 亿美元融资、710 亿美元估值等均为「据报道」,尚无监管备案或官方确认。

02架构没变,变的是后训练

V4-Flash-0731 在参数规模、模型结构上与 4 月预览版完全相同。这和「更强 = 更大」的直觉相反——也印证 2026 年下半年大模型竞争里,后训练数据质量与方法的重要性正在逼近甚至超过堆参数

技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》描述三处关键架构(预览版已具备,0731 沿用):

  • 混合注意力(CSA + HCA): 压缩稀疏注意力与高度压缩注意力结合,对外称 DSA 稀疏注意力,降低长上下文计算与显存开销。
  • 流形约束超连接(mHC): 改进传统残差连接结构。
  • Muon 优化器: 替换传统优化器,提升训练收敛速度与稳定性。
硬核资料 #2: 官方指标:100 万 token 上下文下,V4-Pro 单 token 推理 FLOPs 仅为 V3.2 的 27%,KV Cache 占用仅为 10%(厂商自报,尚无独立第三方复现)。

Harness:DeepSeek 自研 Agent 框架首次亮相

7 月 31 日 changelog 第一次正式出现「DeepSeek Harness」——对标 Claude Code 的 Agent 执行框架,用于读写文件、调用工具、执行命令、完成端到端工程任务。此前 DeepSeek 模型主要依赖 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部用 Harness「极简模式」测出,参数为 max 档位、top_p=0.95、temperature=1.0。

03横向对比:中国开源大模型的「六边形混战」

模型状态总参数 / 激活上下文输入(未命中/命中,$/M)输出($/M)协议
V4-Flash-0731官方(7/31)284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-Pro预览(官方未发)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3权重开源(7/27)2.8T / ~104B(社区估)~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2开源(2026/6)~744B / ~40B1M本文未核实本文未核实MIT
Qwen3.8-MaxAPI GA(8/2),权重待放2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承诺开源
模型Artificial Analysis Intelligence Index单任务平均成本(AA)备注
V4-Flash-073150$0.03第三方独立评测
Kimi K357$0.86第三方独立评测
GLM-5.2比 V4-Flash 高约 1 分本文未核实第三方转引
GPT-5.6 Sol比 V4-Flash 高 9+ 分$1.86闭源
Claude Fable 5比 V4-Flash 高 9+ 分$3.15闭源

有趣反差:V4-Flash 智能分不是最高,甚至落后于 Kimi K3 和 GLM-5.2;但单任务成本仅为 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105。DeepSeek 打的不是「跑分第一」,而是「够用的智能 + 极致的价格」——这也解释预览版为何能在 OpenRouter 连续七周调用量第一。

硬核资料 #3: 据 21 世纪经济报道转引,V4-Flash 官方定价约为 Claude Opus 4.8 的 1/36(缓存未命中输入)1/179(缓存命中输入)1/89(输出)——均为厂商标价,非独立审计。

04争议点:跑分好看,不代表没有水分

  • Harness 依赖: Terminal Bench 2.0 的 82.7 分基于未公开 Harness 极简模式;在 Claude Code、Cursor 等框架独立复现前,应视为「厂商自报 + 特定框架」结果。
  • 可用性反差: 海外开发者反馈缓存命中率偏低、安全分类器超时——与「跑分暴涨」营销叙事形成反差。
  • V4-Pro 上线传言: 快科技等媒体报道「8 月 10–20 日 GA」均为未署名消息源;官方 changelog 原话只是「将尽快发布」。
  • 峰谷加价预告: DeepSeek 已预告未来 API 高峰时段(北京时间 9–12 点、14–18 点)2 倍加价,截至发稿未公布生效日期。

05「斩杀线」与价格战:从「梁白开」到「梁圣」

V4-Pro 迟迟未兑现「7 月中旬全量上线」预期时,中文 AI 社区曾把创始人梁文锋戏称为「梁白开」(谐音「白等」)。V4-Flash-0731 上线后表现超出预期,昵称又翻回「梁圣」——戏谑式反转本身就是观察社区情绪的侧面。

更值得关注的是「斩杀线」说法:DeepSeek 凭借「够用性能 + 极端低价」,给同行设下门槛——友商模型若性能没有明显超过 DeepSeek、又拿不出更低价格,就会失去存在感。这也解释 GPT-5.6 Luna 一次性降价 80% 等密集调价。一位 AI 创业孵化人士对 21 世纪经济报道的评价颇为形象:「所有大模型公司都在梁文锋前面奔跑,不管用什么方式,都必须跑到 DeepSeek 前面才能生存。」

7 月 31 日当天,英伟达、博通、AMD 等算力股并未明显波动——市场似乎已习惯「DeepSeek 式效率突破」,不再简单把「更少算力做到同等效果」等同于利空算力股。这与 2025 年初 DeepSeek-R1 引发全球 AI 芯片股下跌形成鲜明对比。

06六步 Runbook:V4-Flash API 迁移与选型

  1. 01
    核对旧 model 名是否已迁移:若仍调用 deepseek-chatdeepseek-reasoner,立即切换到 deepseek-v4-flash;7 月 24 日起旧名已停用。
  2. 02
    确认接入协议:OpenAI ChatCompletions 与 Anthropic 格式均兼容,deepseek-v4-flash 会自动指向 0731 官方构建,无需改业务代码结构。
  3. 03
    按场景选 Flash 或 Pro 预览:批量 Agent、流水线、成本敏感任务走 Flash-0731;深度推理、世界知识密集任务可暂用 V4-Pro 预览版,等官方版再评估。
  4. 04
    小规模冒烟 + 缓存策略:用 1 万 token 级任务测延迟与质量;固定 system prompt 提升缓存命中率,对照 Kimi K3 做盲测 A/B。
  5. 05
    Agent Harness 独立验证:勿仅凭 Terminal Bench 2.0 厂商数字路由生产流量;在 Claude Code、Cursor 或自有 Harness 上复现关键任务后再放量。
  6. 06
    混合路由与宿主成本:高频 Agent 走 V4-Flash;前沿推理保留 Fable 5。对照 定价页 估算 Agent 宿主月度成本,在 下单页 锁定裸机 Mac 节点试跑长时会话。

07总结与 FAQ

DeepSeek V4-Flash-0731 用同一套 284B 架构证明了 2026 年大模型竞争的新逻辑:后训练质量可以打败参数规模,而极致定价可以重新定义 Agent 批量任务的经济学。但 Harness 依赖的跑分、缓存命中率现实、V4-Pro 上线真空与融资传闻,都要求工程团队以自家 A/B 为准,而非仅看发布会数字。

团队用 V4-Flash 驱动 Agent 对大型代码库长时调用时,仍需要稳定、可审计的本地开发与 CI 平面。共享分钟池、桌下 Mac 或超卖 VPS 上的带宽抖动、邻居 CPU 抢占与长连线中断,会迅速吃掉 Token 降价带来的收益。对更稳定的生产 Agent 主机与构建环境,NUKCLOUD 多区域裸机 Mac / 云端 Mac 节点提供独占 Apple Silicon 算力与清晰租户边界,可在 定价页 对照规格并经 下单页 试跑。

DeepSeek V4 和 V3.2 相比,最大区别是什么?
原生 100 万 token 上下文,长上下文 FLOPs 降至 V3.2 的 27%、KV Cache 降至 10%(官方数据);Agent 能力专项优化,适配 Claude Code、OpenCode 等工具。
日常该选 V4 Flash 还是 V4 Pro?
批量 Agent、低成本大规模调用选 Flash-0731(性价比更高且 Agent 跑分已超 Pro 预览);深度推理、预算不敏感可暂用 Pro 预览,等官方版再评估。
现在能用 V4 Pro 官方版吗?
截至 8 月 5 日不能。仅 V4-Flash-0731 官方版上线且限 API;App/网页仍是旧版。Pro 与 Harness「尽快发布」,8 月 10–20 日为未经证实的传言。
DeepSeek 公布的跑分能信吗?
SWE-bench Verified 等第三方基准可信度较高;Terminal Bench 2.0 等 Agent 跑分基于未公开 Harness,官方也提示对框架高度敏感,建议独立复现后再下结论。
对普通开发者有什么实际影响?
已用 OpenAI/Anthropic 格式接入者无需改代码,deepseek-v4-flash 自动指向新版。仍用 deepseek-chat/deepseek-reasoner 的须尽快迁移。

资料截至 2026-08-05。来源:DeepSeek 官方 API 文档与 changelog、V4 技术报告、Artificial Analysis(经财经媒体转引)、21 世纪经济报道、快科技、V2EX 社区讨论。定价与跑分均为厂商自报或第三方转引,发布前请核实最新状态。