一句話結論: V4-Flash-0731 並非新模型,而是同一套 284B/13B 架構重新做後訓練;在 Terminal Bench 2.0 等 Agent 基準上反超 V4-Pro 預覽版,Artificial Analysis 單任務成本約 $0.03,僅為 Claude Fable 5 的約 1/105。本文從時間線、定價表、架構與後訓練、Harness 框架、橫向對標 Kimi K3/Qwen3.8-Max、跑分爭議、斬殺線背景七個維度拆解,並附六步 Runbook 與 FAQ。若需本地私有部署,可對照 ds4 高記憶體 Mac 雲端推理指南。
00V4-Flash-0731 正式版到底更新了什麼?
2026 年 7 月 31 日,DeepSeek 將 API 端 deepseek-v4-flash 指向 build tag「0731」的官方正式版:開源權重同步上線 Hugging Face(MIT 協議),changelog 首次點名自研 Agent 框架「Harness」。需要釐清的是——這不是參數更大的新模型,總參數仍為 284B、每次推理激活 13B,100 萬 token 上下文窗口亦未改變;官方明確表示性能提升「完全來自重新進行的後訓練」。
此次公測僅限 API,消費端 App 與網頁聊天尚未同步。旗艦 V4-Pro 官方版與 Harness 完整釋出時間,官方僅稱「將盡快發布」,截至 2026 年 8 月 5 日尚無確認日期。
- 隱性成本 #1:跑分與框架綁定。 官方公布的 Agent 類跑分(Terminal Bench 2.0 達 82.7 分)全部以尚未公開的 Harness「極簡模式」測得,無法直接套用到 Claude Code 或 Cursor 等第三方 Agent 環境。
- 隱性成本 #2:Pro 版空窗期。 V4-Pro 預覽版自 4 月即存在,但官方版一再延後;團隊若已按「7 月中旬 GA」排程,可能面臨 Flash 與 Pro 能力邊界重新評估的二次成本。
- 隱性成本 #3:快取與穩定性。 海外開發者社群回報輸入快取命中率偏低、安全分類器偶發逾時等問題,與「跑分暴漲」敘事形成反差,生產環境須預留降級與重試策略。
- 隱性成本 #4:峰谷計費尚未落地但已預告。 DeepSeek 已宣布未來高峰時段(北京時間 9–12 點、14–18 點)費率翻倍,生效日未定,長期 TCO 須納入排程規劃。
01時間線:從 4 月預覽到 7 月「官方版」
| 日期 | 事件 |
|---|---|
| 2026-04-24 | V4 預覽版發布並開源:V4-Pro(1.6T/49B 激活)與 V4-Flash(284B/13B 激活),均支援 1M 上下文,MIT 協議 |
| 2026-07-20 | V4 滿血版(GA)敘事與峰谷計費體系公布;舊介面退役時間表確立 |
| 2026-07-24 | deepseek-chat 與 deepseek-reasoner 永久停用,流量切換至 V4 系列命名 |
| 2026-07-27 | 月之暗面 Kimi K3(2.8T)權重上線 Hugging Face,對 DeepSeek 形成直接競爭壓力 |
| 2026-07-31 | V4-Flash-0731 官方版 API 公測;開源權重同步;changelog 首次點名 Harness |
| 2026-08-02 | 阿里 Qwen3.8-Max API GA,國產大模型「六邊形混戰」加劇 |
| 截至 2026-08-05 | V4-Pro 官方版仍為「盡快發布」;媒體援引未署名消息源稱 8 月 10–20 日可能 GA——未經 DeepSeek 官方證實 |
02核心定價與規格對照
| 模型 | 狀態 | 總參數/激活 | 上下文 | 輸入(快取未命中/命中,$/M) | 輸出($/M) | 協議 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(07-31) | 284B/13B | 1M | $0.14/$0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 預覽版(04-24,官方版未發) | 1.6T/49B | 1M | $0.435/$0.003625 | $0.87 | MIT |
| Kimi K3(月之暗面) | 權重開源(07-27) | 2.8T/~104B(社群估算) | ~1.05M | $3.00/$0.30 | $15.00 | Kimi K3 License |
| GLM-5.2(智譜) | 開源(2026-06) | ~744B/~40B | 1M | 本文未獨立核實 | 本文未獨立核實 | MIT |
| Qwen3.8-Max(阿里) | API GA(08-02),權重待放 | 2.4T/95B | 1M | $2.00/~$0.17–0.25 | $6.00 | 承諾開源 |
03架構不變、後訓練重刷:性能從哪裡來?
V4-Flash-0731 在參數規模與模型結構上與 4 月預覽版完全相同,這與業界預設的「更強=更大」直覺相反。DeepSeek 技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》描述的架構改動(預覽版已具備)包括:
- 混合注意力(CSA + HCA):壓縮稀疏注意力與高度壓縮注意力結合,對外統稱 DSA 稀疏注意力,降低長上下文計算與顯存開銷
- 流形約束超連接(mHC):改進傳統殘差連接,穩定深層訊號傳播
- Muon 優化器:取代傳統優化器,提升收斂速度與訓練穩定性
官方宣稱:1M token 場景下 V4-Pro 單 token 推理 FLOPs 僅為 V3.2 的 27%,KV Cache 占用僅 10%(Flash 低至 7%)。上述為廠商自報效率指標,獨立第三方復現尚待觀察;若基本屬實,百萬級上下文有望以接近主流長度的成本規模商用,而非僅止於行銷參數。
04Harness:DeepSeek 首個自研 Agent 框架
7 月 31 日 changelog 首次正式出現「DeepSeek Harness」——用於讀寫檔案、呼叫工具、執行命令、完成端到端工程任務的自研 Agent 執行框架,對標 Claude Code。在此之前,DeepSeek 團隊多依賴 Claude Code、OpenCode 等第三方 Agent 工具。
關鍵細節:官方公布的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部以 Harness「極簡模式」(minimal mode)測得,參數為 max 檔位、top_p=0.95、temperature=1.0。DeepSeek 在 changelog 中主動提示:「跑分對 harness(執行框架)的選擇非常敏感,不能簡單等同於模型本身能力的提升。」Harness 本身尚未公開釋出。
05橫向對標:國產開源大模型的六邊形混戰
| 模型 | 實驗室 | 發布/權重時間 | 總參數 | Intelligence Index(Artificial Analysis) | 單任務平均成本 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026-07-31(官方版) | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 07-16 預覽/07-27 權重 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智譜/Z.ai | 2026 年 6 月 | ~744B | 比 V4-Flash 約高 1 分 | 本文未核實 |
| Qwen3.8-Max | 阿里 | 08-02 GA(權重待放) | 2.4T | 本文未核實 | 本文未核實 |
| GPT-5.6 Sol | OpenAI | 閉源 | 未公開 | 比 V4-Flash 高 9 分以上 | $1.86 |
| Claude Fable 5 | Anthropic | 閉源 | 未公開 | 比 V4-Flash 高 9 分以上 | $3.15 |
有趣的反差:在 Artificial Analysis 第三方綜合指數上,V4-Flash 並非最高,甚至落後 Kimi K3 與 GLM-5.2;但單任務成本僅為 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能+極致價格」——這也解釋了 V4-Flash 預覽版為何能在 OpenRouter 7 月排行榜 連續數週穩坐呼叫量前列。
06爭議點:跑分好看,不代表沒有水分
- Harness 依賴: Agent 類跑分以自研且未公開框架測得,獨立社群(Hugging Face 博主、海外開發者論壇)復現前,應視為「廠商自報+特定框架」結果
- 可用性問題: 海外開發者回報輸入快取命中率偏低、安全分類器偶發逾時,反映算力與參數儲備仍是能力上限的現實瓶頸
- Pro 版與 Harness 上線時間未證實: 中文媒體援引「8 月 10–20 日 GA」等窗口均為未署名消息源;官方 changelog 原話僅「將盡快發布」
- 融資與 IPO 傳聞需謹慎: 多家媒體報導 DeepSeek 近期完成約 74 億美元融資、估值約 487 億美元等,目前主要來自「據報導」「消息人士稱」,尚無官方或監管備案直接確認
07從「梁白開」到「梁聖」:斬殺線與價格戰下一輪
V4 正式版發布前,因 Pro 版遲遲未兌現「7 月中旬全量上線」預期,中文 AI 社群一度將創辦人梁文鋒戲稱為「梁白開」(諧音「白等」「放空炮」)。V4-Flash-0731 上線後表現超出預期,網友又將「梁聖」稱號還了回去——這種戲謔式暱稱反轉,本身就是觀察中國 AI 社群情緒的有趣指標。
更值得關注的是中文開發者圈流傳的「斬殺線」概念:DeepSeek 以「夠用的性能+極端低價」組合,為同行設下門檻——若性能未明顯超越 DeepSeek、又無法拿出更低價格,便可能在市場上失去存在感。這也解釋了 OpenAI GPT-5.6 Luna 一次性降價 80% 等同期密集定價調整。21 世紀經濟報導援引 AI 創業孵化人士評價:「所有大模型公司都在梁文鋒前面奔跑,不管用什麼方式,都必須跑到 DeepSeek 前面才能生存。」
7 月 31 日 V4-Flash 正式版上線當天,輝達、博通、AMD 等算力晶片股並未明顯波動——市場似乎已習慣「DeepSeek 式效率突破」敘事,不再簡單將「用更少算力做到同等效果」等同於「利空算力股」,與 2025 年初 DeepSeek-R1 發布時全球 AI 晶片股集體回調形成鮮明對比。
08六步 Runbook:V4-Flash-0731 生產接入
-
01
稽核程式碼庫:全域搜尋
deepseek-chat、deepseek-reasoner與deepseek-v4-flash,列出所有呼叫點、環境變數與 fallback 邏輯。 -
02
確認 model 命名:OpenAI/Anthropic 相容客戶端維持
deepseek-v4-flash即可自動指向 0731 正式版;無須改base_url。 -
03
Staging 冒煙測試:在預發環境對比 0731 與舊版 Flash 在 Agent 任務(檔案編輯、工具呼叫、長上下文摘要)上的輸出品質與延遲。
-
04
監控快取命中率:記錄 input cache hit ratio 與安全分類器逾時率;若命中率偏低,調整 prompt 結構或縮短可快取前綴長度。
-
05
建立分層路由:日常批量與 FAQ 走 Flash($0.28/M 輸出);複雜推理保留 Claude Opus 5/GPT-5.6 作為 escalate 目標,避免為少數難例支付全量 frontier 成本。
- 06
09總結與 FAQ
DeepSeek V4-Flash-0731 的價值不在於能否擊敗 Claude Fable 5 或 GPT-5.6 Sol(綜合智能分仍落後),而在於以閉源旗艦約 1/30 至 1/100 的成本,提供大規模 Agent 與批量任務場景下「夠用且極便宜」的選項。架構不變、後訓練重刷的成功,也標誌 2026 年下半年競爭重心正從參數規模轉向後訓練資料與方法論。
團隊以 V4-Flash 驅動長時 Agent 對大型程式碼庫呼叫時,仍需要穩定、可稽核的本地開發與 CI 平面。共享分鐘池、桌下 Mac 或超賣 VPS 上的頻寬抖動、鄰居 CPU 搶占與長連線中斷,會迅速吃掉 Token 降價帶來的收益。對更穩定的生產 Agent 主機,NUKCLOUD 多區域裸金屬 Mac/雲端 Mac 節點提供獨佔 Apple Silicon 算力與清晰租戶邊界,可在 定價頁 對照規格並經 下單頁 試跑。
deepseek-v4-flash 自動指向 0731 正式版。若仍使用已停用的 deepseek-chat/deepseek-reasoner,須切換至新命名。資料截至 2026-08-05。來源:DeepSeek 官方 API 文件與 changelog、arXiv 技術報告、Hugging Face 模型卡、Artificial Analysis、21 世紀經濟報導、Moonshot AI/阿里官方發布資訊。發布前請以官方最新定價、跑分及 V4-Pro/Harness 上線狀態為準。