一句話結論:2026 年 7 月 24 日 Anthropic 發布 Claude Opus 5——定價與 Opus 4.8 相同($5/$25 每百萬 token),CursorBench 3.2 峰值僅比 Fable 5 低 0.5%,成本卻砍半;同期 Kimi K3 遭白宮指控「工業級蒸餾」,而 Ryan Greenblatt 的統計發現 K3 會吐出 claude-opus-4-5-20250929 等內部部署 ID。本文從Opus 5 基準與定價、K3 爭議時間軸、技術證據、選型矩陣四個面向解讀,並附六步 Runbook 與 FAQ。
00Claude Opus 5 發布:不是頂規旗艦,但可能是最值得用的 Claude
2026 年 7 月 24 日(美國太平洋時間),Anthropic 正式發布 Claude Opus 5,並同步設為 Claude Max 預設模型,Claude Pro 使用者也可存取目前公開可用的最強版本。模型 ID 為 claude-opus-5,可透過 Claude API、AWS Bedrock、Google Vertex AI 與 Microsoft Foundry 接入。
- 定價不變:輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens,與 Opus 4.8 完全相同;Fast 模式速度約 2.5 倍、價格 2 倍。
- 上下文:100 萬 tokens(預設且唯一檔位),最大輸出 128K tokens;Thinking 預設開啟,Effort 參數控制思考量。
- 資料留存:與歷代 Opus 一致,預設存取不強制 30 天資料留存;Fable 5 / Mythos 5 則需使用者接受留存政策。
| 基準測試 | Opus 5 表現 | 對比說明 |
|---|---|---|
| Frontier-Bench v0.1 | 超越所有模型 | 是 Opus 4.8 的兩倍以上,單任務成本更低 |
| CursorBench 3.2(max effort) | 與 Fable 5 峰值差 0.5% | 成本僅為 Fable 5 的一半 |
| ARC-AGI 3 | 次優模型的 3 倍 | 新穎問題解決能力躍升 |
| OSWorld 2.0 | 任意成本下最優 | 用 Fable 5 約 1/3 成本超過其最佳成績 |
| Zapier AutomationBench | 100% 通過率 | 此前模型均未通過端到端帳戶健康工作流 |
Box 企業客戶實測:資料分析工作流提升 11%,盡職調查提升 17%,整體準確率提升 8%。生命科學方面,從光譜推斷分子結構比 Opus 4.8 高 10.2 個百分點,蛋白質序列變異功能預測高 7.7 個百分點。
01Claude Opus 5 和 Fable 5 哪個好?選型對比
若你此前覺得 Fable 5 效果好但太貴,Opus 5 提供了「損失極小、成本砍半」的替代方案。下列矩陣協助快速決策:
| 維度 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 輸入價(/M tokens) | $5 | ~$10 |
| 輸出價(/M tokens) | $25 | ~$50 |
| CursorBench 3.2 峰值 | 與 Fable 5 差 0.5% | 最高 |
| Claude Max 預設 | 是(2026-07-24 起) | 否 |
| 資料留存要求 | 預設無強制留存 | 需接受 30 天留存 |
| 雙用途風險能力 | 刻意受限 | 更強(Mythos 5 更強) |
Cursor 團隊評價:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost.」Zapier 則稱 Opus 5 在 AutomationBench 登頂且未消耗更多 token。若需多模型路由,可對照本站 OpenRouter 接入教學 做 Fallback 設定。
02Kimi K3「蒸餾門」:白宮介入,專家質疑時間軸
相較 Opus 5 的「例行新品發表」,Kimi K3 劇情複雜得多。月之暗面於 2026 年 7 月 16 日發布 Kimi K3:總參數 2.8 萬億,896 專家 MoE 每次激活 16 個(約 500 億激活參數),100 萬 token 上下文與原生視覺理解,GPQA-Diamond 93.5%、BrowseComp 91.2%。完整權重承諾 7 月 27 日釋出——爭議爆發時外部尚無法獨立驗證。
| 日期 | 事件 |
|---|---|
| 2026-02 | Anthropic 首次指控月之暗面/DeepSeek/MiniMax「產業級蒸餾攻擊」,稱偵測到 340 萬+ 異常 API 互動 |
| 2026-07-01 | Claude Fable 5 面向公眾正式可用 |
| 2026-07-16 | Kimi K3 API/產品正式發布 |
| 2026-07-22/23 | 白宮 OSTP 主任 Michael Kratsios 公開指控「大規模隱蔽工業級蒸餾」+ 涉嫌違規使用 Nvidia GB300 晶片 |
| 2026-07-23 | TechCrunch 刊載專家質疑蒸餾說的報導 |
| 2026-07-24 | Ryan Greenblatt 發布「K3 自稱 Claude」統計證據 |
| 2026-07-27(計劃) | Kimi K3 完整權重開源 |
Kratsios 原話:「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology… is unacceptable.」財政部長 Scott Bessent 附和稱在多個中國模型上發現美國大模型「浮水印」,但未說明具體指什麼。
- 時間軸反駁:Fable 5 自 7 月 1 日才公開可用,到 K3 發布僅 兩週。Snorkel AI 聯合創辦人 Braden Hancock 直言:「You can't distill that much data, train a model, and release it in two weeks.」
- 邊際收益遞減:Allen AI 研究員 Nathan Lambert 認為,隨著中國模型逼近前沿,簡單蒸餾收益變小,真正拉開差距的是強化學習訓練。
- 產業「雙標」:Elon Musk 曾在庭審中承認 xAI 訓練 Grok 時蒸餾過 OpenAI 模型,並稱這在業界很常見——爭議核心在於「正常借鑑」與「隱蔽竊取」的邊界。
03最硬核證據:Kimi K3 會「自稱 Claude」
Redwood Research 首席科學家 Ryan Greenblatt 在 7 月 24 日前後發布統計分析(GitHub: rgreenblatt/which_claude_is_k3),對比多個模型被問「你是誰」時的身份自認行為。結果令人驚訝:
- Kimi K3 異常高頻自稱 Claude,甚至會吐出 Claude 官方內部部署 ID,如
claude-opus-4-5-20250929、claude-sonnet-4-5-20250929。 - 真正的 Claude 模型自己不會這樣報:Sonnet 4.5 只會說「我是 Claude Sonnet 4.5」,Opus 4.5 甚至不報或報錯版本號。
- 逐代追新規律:K2 訊號指向 Claude Sonnet 4(2025 年中),K3 指向 Opus 4.5(2025 年末),而非當前 Fable/Mythos 系列。
Greenblatt 解讀:模型說出「教師模型」部署中繼資料比教師自己還準,很難用「模仿對話風格」解釋,更可能指向訓練資料混入了帶部署中繼資料標註的 Claude 資料(API 日誌或打標合成資料)。這與本站此前對 Claude Code 指紋與追蹤 的討論形成呼應——模型身份洩漏是偵測資料污染的重要訊號。
痛點開發者選型時的隱性成本與合規風險
- API 帳單 vs 算力帳單:Opus 5 半價逼近旗艦,但若 Agent 跑在共享 VPS 或桌下 Mac 上,佇列抖動與長連線中斷會迅速吃掉 token 降價收益。
- 合規與供應鏈:Fable 5 / Mythos 5 的 30 天資料留存政策對金融、醫療場景是硬門檻;K3 的蒸餾指控則帶來出口管制與政策不確定性。
- 開源驗證窗口:K3 完整權重 7 月 27 日前,所有架構與跑分僅為「官方自評 + 外部猜測」,生產接入存在資訊不對稱。
- 模型路由複雜度:多模型 Fallback(Opus 5 + K3 + 本地推理)需要穩定 CI 與 Agent 宿主,而非僅換 API Key。
04六步 Runbook:本週模型更新後的生產接入
-
01
稽核現有 Claude 呼叫:檢查是否仍指向 Opus 4.8 或 Fable 5;Claude Max 使用者確認控制台已切換至 Opus 5 預設。
-
02
跑 CursorBench / 內部基準冒煙:在 high / max effort 檔位對比 Opus 5 與 Fable 5 在你真實程式碼庫上的通過率與 token 消耗。
-
03
評估資料留存條款:合規敏感場景優先 Opus 5(無強制留存);若需 Fable 5 峰值能力,單獨評估 30 天留存政策影響。
-
04
暫緩 K3 生產接入:等待 7 月 27 日權重釋出後,獨立複現 GPQA-Diamond / SWE Marathon 等基準,並執行 Greenblatt 式身份探針測試。
-
05
設定多模型路由:經 OpenRouter 或 LiteLLM 設定 Opus 5 主路由 + 開源 Fallback,並記錄每次呼叫的模型 ID 與成本。
-
06
部署穩定 Agent 宿主:長時 Agent 會話需要獨佔算力與穩定 SSH。對照 定價頁 評估 NUKCLOUD 獨佔 Mac 節點作為 CI 與 Agent 建置平面,避免共享池尾延遲吞噬 API 成本優勢。
05兩件事放在一起看:性價比才是主戰場
Opus 5 以「半價逼近旗艦」回應市場對性價比的訴求;Kimi K3 以「開源 + 低價 + 少拒答」衝擊市場;圍繞 K3 的爭議,本質上是各家在性價比戰爭裡對「你的低價是靠技術優化還是白嫖別人模型」的公開攤牌。
對一般開發者:先看場景,再看立場。合規、資料留存、供應鏈敏感 → Opus 5 性價比極高;極限成本與開源可控 → 等 7 月 27 日 K3 權重實測後再決策。Reddit r/LocalLLaMA 上三方聲音並存:歡呼開源閉源差距縮短到「天」而非「月」;調侃 2.8T 參數本地跑不動;務實派認為 K3 真正賣點是低價 + 無審查,而非「打敗 Fable 5」。
團隊用 Opus 5 或 K3 驅動長時 Agent 對大型程式碼庫呼叫時,仍需要穩定、可稽核的本地開發與 CI 平面。共享分鐘池、桌下 Mac 或超賣 VPS 上的頻寬抖動、鄰居 CPU 爭搶與長連線中斷,會迅速吃掉 Token 降價帶來的收益。對更穩定的生產 Agent 主機,NUKCLOUD 多區域裸金屬 Mac / 雲端 Mac 節點提供獨佔 Apple Silicon 算力與清晰租戶邊界,可在 定價頁 對照規格並經 下單頁 試跑。
06總結與 FAQ
claude-opus-4-5-20250929 等內部部署 ID,比真正的 Claude 模型自己報得還準,可能指向訓練資料混入了帶部署中繼資料標註的 Claude API 日誌或合成資料。資料截至 2026-07-25。來源:Anthropic 官方發布、Moonshot/Kimi 技術博客、TechCrunch、Ryan Greenblatt GitHub、CNBC、The Verge。