一句話結論: DeepSeek V4 GA 以 MIT 開源 + 1M token 上下文 + SWE-bench Verified 80.6% 開源紀錄,在閉源旗艦約 1/10 乃至 1/100 的成本下提供開源模型最強性能。本文從時間線、技術架構(CSA/HCA/mHC/Muon)、Benchmark 跑分、對標 GPT-5.6 / Claude Fable 5、峰谷計費、7 月 24 日 API 遷移六個維度完整解讀,並附六步 Runbook 與 FAQ。若需本地私有部署,可對照本站 ds4 高記憶體 Mac 雲端推理指南。
00DeepSeek V4 滿血版是什麼?
DeepSeek V4 滿血版(GA,General Availability)是 DeepSeek 於 2026 年 7 月 20 日正式上線的生產級大模型家族,包含 V4-Pro(1.6T 參數) 與 V4-Flash(284B 參數) 兩個規格,均以 MIT 協議開源,支援 100 萬 token 上下文與最高 384K token 輸出。
相比 4 月預覽版,GA 版本在 Agent 任務、數學推理與程式碼生成上做了專項提升,並配套正式的商業化計費體系——峰谷差異化定價。舊介面名 deepseek-chat 與 deepseek-reasoner 將於 7 月 24 日永久下線。
- 開源可自託管:MIT 協議,企業可私有部署滿足資料出境合規。
- 1M 上下文實測可用:KV Cache 記憶體僅為 V3.2 的 10%(Flash 低至 7%)。
- 開源 SWE-bench 紀錄:Verified 80.6%,與 Gemini 3.1 Pro 並列開源最高。
- 極致 API 性價比:V4-Pro 輸出平時 $0.87/M,高峰 $1.74/M,約為 Claude Fable 5 的 1/57。
01時間線:從預覽版到滿血版
| 時間 | 事件 |
|---|---|
| 2026-04-24 | V4 預覽版上線 + 開源(MIT),含 V4-Pro(1.6T)與 V4-Flash(284B) |
| 2026-05 | 生產調優版本上線,API 正式可用 |
| 2026-06 | V4-Pro 價格永久降價 75%(輸出 $0.87/M tokens) |
| 2026-06-29 | 向全體 API 使用者發郵件,宣布 GA 將於 7 月中旬上線,首次披露峰谷計費 |
| 2026-07-19 | 多位開發者獲 GA 灰度內測資格,媒體稱「滿血版最快明日發布」 |
| 2026-07-20 | GA 正式版上線(本文發布日) |
| 2026-07-24 | 舊介面 deepseek-chat / deepseek-reasoner 永久下線 |
02技術架構深度解析
模型家族一覽
| 規格 | V4-Pro | V4-Flash |
|---|---|---|
| 總參數量 | 1.6 萬億(1.6T) | 2840 億(284B) |
| 每 Token 啟用參數 | 490 億(49B) | 130 億(13B) |
| Transformer 層數 | 61 層 | 43 層 |
| 上下文視窗 | 1,000,000 tokens | 1,000,000 tokens |
| 最大輸出 | 384K tokens | 384K tokens |
| 精度 | FP4(專家權重)+ FP8(其餘) | FP4 + FP8 混合 |
| 預訓練資料量 | 33T+ tokens | 32T+ tokens |
| 開源協議 | MIT | MIT |
混合注意力機制(CSA + HCA)
DeepSeek V4 拋棄 V2/V3 時代的 MLA,採用兩種全新注意力機制的混合體:
壓縮稀疏注意力(CSA):KV 序列經 Softmax 門控池化壓縮 4 倍,再用 FP4「閃電索引器」做 top-k 稀疏選擇(Pro 選 top-1024,Flash 選 top-512),同時保留最近 128 token 滑動視窗。1M 上下文下相比 V3.2 僅需 27% 推理 FLOPs。
重度壓縮注意力(HCA):將 token 壓縮 128 倍後做全域密集注意力,捕獲長程依賴。Flash 前 2 層用 HCA,之後 CSA/HCA 交替;Pro 結構類似。
綜合效果:1M token 場景下 KV Cache 記憶體僅為 V3.2 的 10%(Flash 低至 7%)。
流形約束超連接(mHC)與 Muon 優化器
mHC 升級傳統殘差連接,引入 4 通道殘差流與雙隨機矩陣約束(Birkhoff 多面體),確保 61 層深網路中訊號穩定傳播。Muon 優化器透過牛頓-舒爾茲正交化處理梯度,收斂更快、訓練更穩定。
三種推理模式
| 模式 | 特點 | 適用場景 |
|---|---|---|
| Non-think | 無思維鏈,極速回應 | 簡單問答、路由分發 |
| Think High | 顯式推理(<redacted_thinking> 標籤) | 中等複雜任務、程式碼除錯 |
| Think Max | 最大推理力度,需 384K+ 上下文 | 複雜數學、長鏈路 Agent |
官方推薦取樣參數:temperature=1.0, top_p=1.0(全模式通用)。
03Benchmark 跑分:開源之王的成績單
| 基準測試 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(開源最高) | 96.0% | 未單獨公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified 是「真實 GitHub 儲存庫 Bug 修復」測試,80.6% 為當前開源模型最高分。SWE-bench Pro 更嚴格,Claude Fable 5 以 80.3% 領先。
性價比橫向對比
Artificial Analysis 評測資料(Strategy & Ops 指數任務):
- Claude Fable 5:每次 $3.48,得分 50 分
- DeepSeek V4-Pro:每次 $0.03,得分 38 分
- DeepSeek V4-Flash:六類指數任務每次均低於 $0.04
Fable 5 成本是 V4-Pro 的 116 倍,得分僅高出約 12 分(31%)。對照 Kimi K3 評測:K3 參數更大但 API 輸出 $15/M,V4-Pro 在成本敏感場景仍具壓倒優勢。
04與 GPT-5.6 / Claude Fable 5 全面對比
| 維度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 開源 | MIT 協議 | 閉源 | 閉源 |
| 可自託管 | 支援 | 不支援 | 不支援 |
| 上下文視窗 | 1M tokens | 未公開 | 1M tokens |
| 程式碼能力 | 極強(接近 Fable 5) | 極強 | 最強 |
| API 輸出價(平時) | $0.87/M tokens | ~$15/M | $50/M |
| 峰值輸出價 | $1.74/M tokens | — | — |
| Agent 能力 | 強,支援多 Agent 編排 | 強 | 最強 |
| 資料隱私 | 可私有部署 | 不支援 | 不支援 |
選型建議:
- 預算有限 / 高頻呼叫 / 私有部署:首選 V4-Pro 或 V4-Flash
- 極致程式碼能力、不在乎成本:Claude Fable 5(SWE-bench Pro 最高分)
- 複雜演算法 + 數學推理:GPT-5.6 Sol / Ultra
- 超大規模日誌/文件處理:V4-Flash(快取命中輸入僅 $0.0028/M)
05峰谷計費詳解:該怎麼省錢?
GA 版本最受關注的變化:DeepSeek 首次引入峰谷差異化定價,類似電網分時電價。高峰時段(北京時間):工作日 09:00–12:00 和 14:00–18:00,費率翻倍。
| 模型 | 計費項 | 平時(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 輸入(快取命中) | ¥0.025 / $0.0035 / 1M | 翻倍 |
| 輸入(快取未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 輸出 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 輸入(快取命中) | ¥0.02 / $0.0028 / 1M | 翻倍 |
| 輸入(快取未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 輸出 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
省錢四策:
- 非即時任務排到非高峰(18:00 後或 9:00 前)
- 善用 Prompt Cache,V4-Flash 快取命中僅 $0.0028/M
- Flash 做分流:簡單路由用 Flash,複雜推理轉 Pro
- 關注計費變更郵件(DeepSeek 承諾 24 小時前通知)
即使高峰期,V4-Pro 輸出 $1.74/M 仍比 Claude Opus 4.8($15/M)便宜 8.6 倍。
06API 遷移指南(7 月 24 日截止)
deepseek-chat 和 deepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC(北京時間 23:59) 永久停止存取。| 舊模型名 | 新模型名 | 備註 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考模式) | 速度快,適合輕量任務 |
deepseek-reasoner | deepseek-v4-flash(思考模式) | 或升級 deepseek-v4-pro 獲取更強推理 |
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
)
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
V4 同時支援 OpenAI ChatCompletions 與 Anthropic Messages 格式,base_url 不變,僅需更新 model 參數。
07六步 Runbook:V4 GA 生產接入
-
01
稽核程式碼庫:全域搜尋
deepseek-chat與deepseek-reasoner,列出所有呼叫點與環境變數。 -
02
選擇目標模型:輕量對話走
deepseek-v4-flash;複雜 Agent/程式碼走deepseek-v4-pro;思考模式用extra_body啟用。 -
03
Staging 冒煙測試:在 7 月 24 日前於預發環境驗證 Non-think / Think High / Think Max 三模式輸出品質。
-
04
配置峰谷排程:批次文件處理、程式碼審查等離線任務 cron 到 18:00 後或週末,快取命中目標 80%+。
-
05
建立 Flash→Pro 路由:意圖分類與 FAQ 走 Flash($0.28/M 輸出),複雜推理再 escalate 到 Pro。
-
06
部署 Agent 宿主:長時 V4 Agent 會話需要穩定 SSH 與無鄰居搶佔算力。對照 定價頁 評估 NUKCLOUD 獨佔 Mac 節點作為 CI 與 Agent 建構平面,避免共享池尾延遲吞噬 API 成本優勢。
08總結與 FAQ
DeepSeek V4 GA 是 2026 年開源大模型領域最重要的里程碑之一。其價值不在於能否擊敗 Claude Fable 5 或 GPT-5.6(暫時還不能),而在於以閉源旗艦 1/10 乃至 1/100 的成本,提供開源模型中無可爭議的最強性能。峰谷計費增加了成本複雜度,但本質上仍極具競爭力——DeepSeek 從「價格屠夫」到「有規則的商業平台」的轉型,是成熟化訊號。
團隊用 V4 驅動長時 Agent 對大型程式碼庫呼叫時,仍需要穩定、可稽核的本地開發與 CI 平面。共享分鐘池、桌下 Mac 或超賣 VPS 上的頻寬抖動、鄰居 CPU 搶佔與長連線中斷,會迅速吃掉 Token 降價帶來的收益。對更穩定的生產 Agent 主機,NUKCLOUD 多區域裸金屬 Mac / 雲端 Mac 節點提供獨佔 Apple Silicon 算力與清晰租戶邊界,可在 定價頁 對照規格並經 下單頁 試跑。
deepseek-v4-flash 或 deepseek-v4-pro。資料截至 2026-07-20。來源:DeepSeek 官方文件、arXiv:2606.19348、HuggingFace 模型頁、LLMReference、Artificial Analysis、MangoMind Blog。