DeepSeek V4 Flash正式版評測:跑分逼近 Opus 4.8,價格便宜近百倍,Pro 版還要等多久?

7 月 31 日 DeepSeek 將 V4-Flash 升級為官方版(build 0731):參數規模不變、僅重跑後訓練,Agent 跑分卻反超自家更大的 V4-Pro 預覽版;API 定價僅為 Claude Opus 4.8 的幾十分之一。旗艦 V4-Pro 官方版與自研 Agent 框架 Harness,目前仍停留在「即將發布」。

一句話結論: V4-Flash-0731 並非新模型,而是同一套 284B/13B 架構重新做後訓練;在 Terminal Bench 2.0 等 Agent 基準上反超 V4-Pro 預覽版,Artificial Analysis 單任務成本約 $0.03,僅為 Claude Fable 5 的約 1/105。本文從時間線、定價表、架構與後訓練、Harness 框架、橫向對標 Kimi K3Qwen3.8-Max、跑分爭議、斬殺線背景七個維度拆解,並附六步 Runbook 與 FAQ。若需本地私有部署,可對照 ds4 高記憶體 Mac 雲端推理指南

00V4-Flash-0731 正式版到底更新了什麼?

2026 年 7 月 31 日,DeepSeek 將 API 端 deepseek-v4-flash 指向 build tag「0731」的官方正式版:開源權重同步上線 Hugging Face(MIT 協議),changelog 首次點名自研 Agent 框架「Harness」。需要釐清的是——這不是參數更大的新模型,總參數仍為 284B、每次推理激活 13B,100 萬 token 上下文窗口亦未改變;官方明確表示性能提升「完全來自重新進行的後訓練」。

此次公測僅限 API,消費端 App 與網頁聊天尚未同步。旗艦 V4-Pro 官方版與 Harness 完整釋出時間,官方僅稱「將盡快發布」,截至 2026 年 8 月 5 日尚無確認日期。

  • 隱性成本 #1:跑分與框架綁定。 官方公布的 Agent 類跑分(Terminal Bench 2.0 達 82.7 分)全部以尚未公開的 Harness「極簡模式」測得,無法直接套用到 Claude Code 或 Cursor 等第三方 Agent 環境。
  • 隱性成本 #2:Pro 版空窗期。 V4-Pro 預覽版自 4 月即存在,但官方版一再延後;團隊若已按「7 月中旬 GA」排程,可能面臨 Flash 與 Pro 能力邊界重新評估的二次成本。
  • 隱性成本 #3:快取與穩定性。 海外開發者社群回報輸入快取命中率偏低、安全分類器偶發逾時等問題,與「跑分暴漲」敘事形成反差,生產環境須預留降級與重試策略。
  • 隱性成本 #4:峰谷計費尚未落地但已預告。 DeepSeek 已宣布未來高峰時段(北京時間 9–12 點、14–18 點)費率翻倍,生效日未定,長期 TCO 須納入排程規劃。

01時間線:從 4 月預覽到 7 月「官方版」

日期事件
2026-04-24V4 預覽版發布並開源:V4-Pro(1.6T/49B 激活)與 V4-Flash(284B/13B 激活),均支援 1M 上下文,MIT 協議
2026-07-20V4 滿血版(GA)敘事與峰谷計費體系公布;舊介面退役時間表確立
2026-07-24deepseek-chatdeepseek-reasoner 永久停用,流量切換至 V4 系列命名
2026-07-27月之暗面 Kimi K3(2.8T)權重上線 Hugging Face,對 DeepSeek 形成直接競爭壓力
2026-07-31V4-Flash-0731 官方版 API 公測;開源權重同步;changelog 首次點名 Harness
2026-08-02阿里 Qwen3.8-Max API GA,國產大模型「六邊形混戰」加劇
截至 2026-08-05V4-Pro 官方版仍為「盡快發布」;媒體援引未署名消息源稱 8 月 10–20 日可能 GA——未經 DeepSeek 官方證實

02核心定價與規格對照

模型狀態總參數/激活上下文輸入(快取未命中/命中,$/M)輸出($/M)協議
DeepSeek-V4-Flash-0731官方正式版(07-31)284B/13B1M$0.14/$0.0028$0.28MIT
DeepSeek-V4-Pro預覽版(04-24,官方版未發)1.6T/49B1M$0.435/$0.003625$0.87MIT
Kimi K3(月之暗面)權重開源(07-27)2.8T/~104B(社群估算)~1.05M$3.00/$0.30$15.00Kimi K3 License
GLM-5.2(智譜)開源(2026-06)~744B/~40B1M本文未獨立核實本文未獨立核實MIT
Qwen3.8-Max(阿里)API GA(08-02),權重待放2.4T/95B1M$2.00/~$0.17–0.25$6.00承諾開源
硬核資料 #1: 據 21 世紀經濟報導轉引,V4-Flash 官方定價相較 Claude Opus 4.8:快取未命中輸入約便宜 36 倍、快取命中輸入約 179 倍、輸出約 89 倍(均為廠商牌價,非獨立審計)。
硬核資料 #2: Artificial Analysis Intelligence Index 顯示 V4-Flash 綜合分 50、單任務平均成本 $0.03;Kimi K3 分數 57、成本 $0.86——智能分略低,成本約為 1/29。
硬核資料 #3: 官方自報 Terminal Bench 2.0:V4-Flash-0731 得 82.7 分,V4-Pro 預覽版僅 67.9 分——284B 小模型在 Agent 基準上反超 1.6T 大模型,印證 2026 年下半年「後訓練品質」正逼近「堆參數」的重要性。

03架構不變、後訓練重刷:性能從哪裡來?

V4-Flash-0731 在參數規模與模型結構上與 4 月預覽版完全相同,這與業界預設的「更強=更大」直覺相反。DeepSeek 技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》描述的架構改動(預覽版已具備)包括:

  • 混合注意力(CSA + HCA):壓縮稀疏注意力與高度壓縮注意力結合,對外統稱 DSA 稀疏注意力,降低長上下文計算與顯存開銷
  • 流形約束超連接(mHC):改進傳統殘差連接,穩定深層訊號傳播
  • Muon 優化器:取代傳統優化器,提升收斂速度與訓練穩定性

官方宣稱:1M token 場景下 V4-Pro 單 token 推理 FLOPs 僅為 V3.2 的 27%,KV Cache 占用僅 10%(Flash 低至 7%)。上述為廠商自報效率指標,獨立第三方復現尚待觀察;若基本屬實,百萬級上下文有望以接近主流長度的成本規模商用,而非僅止於行銷參數。

04Harness:DeepSeek 首個自研 Agent 框架

7 月 31 日 changelog 首次正式出現「DeepSeek Harness」——用於讀寫檔案、呼叫工具、執行命令、完成端到端工程任務的自研 Agent 執行框架,對標 Claude Code。在此之前,DeepSeek 團隊多依賴 Claude Code、OpenCode 等第三方 Agent 工具。

關鍵細節:官方公布的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部以 Harness「極簡模式」(minimal mode)測得,參數為 max 檔位、top_p=0.95、temperature=1.0。DeepSeek 在 changelog 中主動提示:「跑分對 harness(執行框架)的選擇非常敏感,不能簡單等同於模型本身能力的提升。」Harness 本身尚未公開釋出。

05橫向對標:國產開源大模型的六邊形混戰

模型實驗室發布/權重時間總參數Intelligence Index(Artificial Analysis)單任務平均成本
DeepSeek-V4-Flash-0731DeepSeek2026-07-31(官方版)284B50$0.03
Kimi K3月之暗面07-16 預覽/07-27 權重2.8T57$0.86
GLM-5.2智譜/Z.ai2026 年 6 月~744B比 V4-Flash 約高 1 分本文未核實
Qwen3.8-Max阿里08-02 GA(權重待放)2.4T本文未核實本文未核實
GPT-5.6 SolOpenAI閉源未公開比 V4-Flash 高 9 分以上$1.86
Claude Fable 5Anthropic閉源未公開比 V4-Flash 高 9 分以上$3.15

有趣的反差:在 Artificial Analysis 第三方綜合指數上,V4-Flash 並非最高,甚至落後 Kimi K3 與 GLM-5.2;但單任務成本僅為 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能+極致價格」——這也解釋了 V4-Flash 預覽版為何能在 OpenRouter 7 月排行榜 連續數週穩坐呼叫量前列。

06爭議點:跑分好看,不代表沒有水分

  • Harness 依賴: Agent 類跑分以自研且未公開框架測得,獨立社群(Hugging Face 博主、海外開發者論壇)復現前,應視為「廠商自報+特定框架」結果
  • 可用性問題: 海外開發者回報輸入快取命中率偏低、安全分類器偶發逾時,反映算力與參數儲備仍是能力上限的現實瓶頸
  • Pro 版與 Harness 上線時間未證實: 中文媒體援引「8 月 10–20 日 GA」等窗口均為未署名消息源;官方 changelog 原話僅「將盡快發布」
  • 融資與 IPO 傳聞需謹慎: 多家媒體報導 DeepSeek 近期完成約 74 億美元融資、估值約 487 億美元等,目前主要來自「據報導」「消息人士稱」,尚無官方或監管備案直接確認

07從「梁白開」到「梁聖」:斬殺線與價格戰下一輪

V4 正式版發布前,因 Pro 版遲遲未兌現「7 月中旬全量上線」預期,中文 AI 社群一度將創辦人梁文鋒戲稱為「梁白開」(諧音「白等」「放空炮」)。V4-Flash-0731 上線後表現超出預期,網友又將「梁聖」稱號還了回去——這種戲謔式暱稱反轉,本身就是觀察中國 AI 社群情緒的有趣指標。

更值得關注的是中文開發者圈流傳的「斬殺線」概念:DeepSeek 以「夠用的性能+極端低價」組合,為同行設下門檻——若性能未明顯超越 DeepSeek、又無法拿出更低價格,便可能在市場上失去存在感。這也解釋了 OpenAI GPT-5.6 Luna 一次性降價 80% 等同期密集定價調整。21 世紀經濟報導援引 AI 創業孵化人士評價:「所有大模型公司都在梁文鋒前面奔跑,不管用什麼方式,都必須跑到 DeepSeek 前面才能生存。」

7 月 31 日 V4-Flash 正式版上線當天,輝達、博通、AMD 等算力晶片股並未明顯波動——市場似乎已習慣「DeepSeek 式效率突破」敘事,不再簡單將「用更少算力做到同等效果」等同於「利空算力股」,與 2025 年初 DeepSeek-R1 發布時全球 AI 晶片股集體回調形成鮮明對比。

08六步 Runbook:V4-Flash-0731 生產接入

  1. 01
    稽核程式碼庫:全域搜尋 deepseek-chatdeepseek-reasonerdeepseek-v4-flash,列出所有呼叫點、環境變數與 fallback 邏輯。
  2. 02
    確認 model 命名:OpenAI/Anthropic 相容客戶端維持 deepseek-v4-flash 即可自動指向 0731 正式版;無須改 base_url
  3. 03
    Staging 冒煙測試:在預發環境對比 0731 與舊版 Flash 在 Agent 任務(檔案編輯、工具呼叫、長上下文摘要)上的輸出品質與延遲。
  4. 04
    監控快取命中率:記錄 input cache hit ratio 與安全分類器逾時率;若命中率偏低,調整 prompt 結構或縮短可快取前綴長度。
  5. 05
    建立分層路由:日常批量與 FAQ 走 Flash($0.28/M 輸出);複雜推理保留 Claude Opus 5/GPT-5.6 作為 escalate 目標,避免為少數難例支付全量 frontier 成本。
  6. 06
    部署 Agent 宿主:長時 V4 Agent 會話需要穩定 SSH 與無鄰居搶占算力。對照 定價頁 評估 NUKCLOUD 獨佔 Mac 節點作為 CI 與 Agent 建置平面,避免共享池尾延遲吞噬 API 降價收益;可經 下單頁 試跑。

09總結與 FAQ

DeepSeek V4-Flash-0731 的價值不在於能否擊敗 Claude Fable 5 或 GPT-5.6 Sol(綜合智能分仍落後),而在於以閉源旗艦約 1/30 至 1/100 的成本,提供大規模 Agent 與批量任務場景下「夠用且極便宜」的選項。架構不變、後訓練重刷的成功,也標誌 2026 年下半年競爭重心正從參數規模轉向後訓練資料與方法論。

團隊以 V4-Flash 驅動長時 Agent 對大型程式碼庫呼叫時,仍需要穩定、可稽核的本地開發與 CI 平面。共享分鐘池、桌下 Mac 或超賣 VPS 上的頻寬抖動、鄰居 CPU 搶占與長連線中斷,會迅速吃掉 Token 降價帶來的收益。對更穩定的生產 Agent 主機,NUKCLOUD 多區域裸金屬 Mac/雲端 Mac 節點提供獨佔 Apple Silicon 算力與清晰租戶邊界,可在 定價頁 對照規格並經 下單頁 試跑。

DeepSeek V4 和 V3.2 最大的差別是什麼?
原生支援 100 萬 token 上下文,長上下文場景下 FLOPs 與 KV Cache 大幅降低。V4 系列另針對 Agent 能力做後訓練優化,可搭配 Claude Code、OpenCode 等主流 Agent 工具。
日常該選 V4 Flash 還是 V4 Pro?
一般對話、批量處理或 Agent 流水線優先 V4-Flash-0731 正式版。若需更深世界知識或複雜推理且預算充裕,可暫用 V4-Pro 預覽版,待官方版上線後再評估。
現在能用 V4 Pro 官方版嗎?
截至 2026 年 8 月 5 日尚不能。目前正式版僅 V4-Flash-0731,且僅限 API。V4-Pro 官方版與 Harness 官方口徑為「盡快發布」;網傳 8 月 10–20 日為未證實傳言。
DeepSeek 公布的跑分能直接相信嗎?
SWE-bench Verified 等第三方基準可信度較高。Terminal Bench 2.0 等 Agent 跑分以 Harness 極簡模式測得,官方亦提示對框架選擇高度敏感,宜等獨立復現後再下結論。
這次更新對一般開發者有什麼實際影響?
已用 OpenAI/Anthropic 格式接入者無須改程式碼,deepseek-v4-flash 自動指向 0731 正式版。若仍使用已停用的 deepseek-chatdeepseek-reasoner,須切換至新命名。
什麼是 DeepSeek Harness?
DeepSeek 首個自研 Agent 執行框架,對標 Claude Code,用於檔案 I/O、工具呼叫與多步驟工程任務。7 月 31 日 changelog 首次點名,尚未公開釋出。

資料截至 2026-08-05。來源:DeepSeek 官方 API 文件與 changelog、arXiv 技術報告、Hugging Face 模型卡、Artificial Analysis、21 世紀經濟報導、Moonshot AI/阿里官方發布資訊。發布前請以官方最新定價、跑分及 V4-Pro/Harness 上線狀態為準。