Claude Opus 5 半價逼近旗艦實力,Kimi K3 陷「自稱 Claude」蒸餾風波

本週 AI 圈兩件大事表面無關,底層卻指向同一命題——性價比模型能力究竟從哪來:Anthropic 推出日常主力 Claude Opus 5;月之暗面 Kimi K3 則遭白宮公開指控「蒸餾」Anthropic 技術,更有研究者發現它會自稱 Claude

一句話結論:2026 年 7 月 24 日 Anthropic 發布 Claude Opus 5——定價與 Opus 4.8 相同($5/$25 每百萬 token),CursorBench 3.2 峰值僅比 Fable 5 低 0.5%,成本卻砍半;同期 Kimi K3 遭白宮指控「工業級蒸餾」,而 Ryan Greenblatt 的統計發現 K3 會吐出 claude-opus-4-5-20250929 等內部部署 ID。本文從Opus 5 基準與定價、K3 爭議時間軸、技術證據、選型矩陣四個面向解讀,並附六步 Runbook 與 FAQ。

00Claude Opus 5 發布:不是頂規旗艦,但可能是最值得用的 Claude

2026 年 7 月 24 日(美國太平洋時間),Anthropic 正式發布 Claude Opus 5,並同步設為 Claude Max 預設模型,Claude Pro 使用者也可存取目前公開可用的最強版本。模型 ID 為 claude-opus-5,可透過 Claude API、AWS Bedrock、Google Vertex AI 與 Microsoft Foundry 接入。

  • 定價不變:輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens,與 Opus 4.8 完全相同;Fast 模式速度約 2.5 倍、價格 2 倍。
  • 上下文:100 萬 tokens(預設且唯一檔位),最大輸出 128K tokens;Thinking 預設開啟,Effort 參數控制思考量。
  • 資料留存:與歷代 Opus 一致,預設存取不強制 30 天資料留存;Fable 5 / Mythos 5 則需使用者接受留存政策。
基準測試Opus 5 表現對比說明
Frontier-Bench v0.1超越所有模型是 Opus 4.8 的兩倍以上,單任務成本更低
CursorBench 3.2(max effort)與 Fable 5 峰值差 0.5%成本僅為 Fable 5 的一半
ARC-AGI 3次優模型的 3 倍新穎問題解決能力躍升
OSWorld 2.0任意成本下最優用 Fable 5 約 1/3 成本超過其最佳成績
Zapier AutomationBench100% 通過率此前模型均未通過端到端帳戶健康工作流

Box 企業客戶實測:資料分析工作流提升 11%,盡職調查提升 17%,整體準確率提升 8%。生命科學方面,從光譜推斷分子結構比 Opus 4.8 高 10.2 個百分點,蛋白質序列變異功能預測高 7.7 個百分點

安全定位:Opus 5 是 Anthropic 迄今最對齊的模型(欺騙行為最低),但刻意未刷新網路安全/生物安全前沿——該位置仍由受限發行的 Mythos 5 佔據。網路安全分類器比 Fable 5 寬鬆約 85%,可用於原始碼級漏洞發現,仍封鎖二進位漏洞掃描與 exploit 生成。

01Claude Opus 5 和 Fable 5 哪個好?選型對比

若你此前覺得 Fable 5 效果好但太貴,Opus 5 提供了「損失極小、成本砍半」的替代方案。下列矩陣協助快速決策:

維度Claude Opus 5Claude Fable 5
輸入價(/M tokens)$5~$10
輸出價(/M tokens)$25~$50
CursorBench 3.2 峰值與 Fable 5 差 0.5%最高
Claude Max 預設是(2026-07-24 起)
資料留存要求預設無強制留存需接受 30 天留存
雙用途風險能力刻意受限更強(Mythos 5 更強)

Cursor 團隊評價:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost.」Zapier 則稱 Opus 5 在 AutomationBench 登頂且未消耗更多 token。若需多模型路由,可對照本站 OpenRouter 接入教學 做 Fallback 設定。

02Kimi K3「蒸餾門」:白宮介入,專家質疑時間軸

相較 Opus 5 的「例行新品發表」,Kimi K3 劇情複雜得多。月之暗面於 2026 年 7 月 16 日發布 Kimi K3:總參數 2.8 萬億,896 專家 MoE 每次激活 16 個(約 500 億激活參數),100 萬 token 上下文與原生視覺理解,GPQA-Diamond 93.5%、BrowseComp 91.2%。完整權重承諾 7 月 27 日釋出——爭議爆發時外部尚無法獨立驗證。

日期事件
2026-02Anthropic 首次指控月之暗面/DeepSeek/MiniMax「產業級蒸餾攻擊」,稱偵測到 340 萬+ 異常 API 互動
2026-07-01Claude Fable 5 面向公眾正式可用
2026-07-16Kimi K3 API/產品正式發布
2026-07-22/23白宮 OSTP 主任 Michael Kratsios 公開指控「大規模隱蔽工業級蒸餾」+ 涉嫌違規使用 Nvidia GB300 晶片
2026-07-23TechCrunch 刊載專家質疑蒸餾說的報導
2026-07-24Ryan Greenblatt 發布「K3 自稱 Claude」統計證據
2026-07-27(計劃)Kimi K3 完整權重開源

Kratsios 原話:「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology… is unacceptable.」財政部長 Scott Bessent 附和稱在多個中國模型上發現美國大模型「浮水印」,但未說明具體指什麼。

  • 時間軸反駁:Fable 5 自 7 月 1 日才公開可用,到 K3 發布僅 兩週。Snorkel AI 聯合創辦人 Braden Hancock 直言:「You can't distill that much data, train a model, and release it in two weeks.」
  • 邊際收益遞減:Allen AI 研究員 Nathan Lambert 認為,隨著中國模型逼近前沿,簡單蒸餾收益變小,真正拉開差距的是強化學習訓練。
  • 產業「雙標」:Elon Musk 曾在庭審中承認 xAI 訓練 Grok 時蒸餾過 OpenAI 模型,並稱這在業界很常見——爭議核心在於「正常借鑑」與「隱蔽竊取」的邊界。

03最硬核證據:Kimi K3 會「自稱 Claude」

Redwood Research 首席科學家 Ryan Greenblatt 在 7 月 24 日前後發布統計分析(GitHub: rgreenblatt/which_claude_is_k3),對比多個模型被問「你是誰」時的身份自認行為。結果令人驚訝:

  • Kimi K3 異常高頻自稱 Claude,甚至會吐出 Claude 官方內部部署 ID,如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929
  • 真正的 Claude 模型自己不會這樣報:Sonnet 4.5 只會說「我是 Claude Sonnet 4.5」,Opus 4.5 甚至不報或報錯版本號。
  • 逐代追新規律:K2 訊號指向 Claude Sonnet 4(2025 年中),K3 指向 Opus 4.5(2025 年末),而非當前 Fable/Mythos 系列。

Greenblatt 解讀:模型說出「教師模型」部署中繼資料比教師自己還準,很難用「模仿對話風格」解釋,更可能指向訓練資料混入了帶部署中繼資料標註的 Claude 資料(API 日誌或打標合成資料)。這與本站此前對 Claude Code 指紋與追蹤 的討論形成呼應——模型身份洩漏是偵測資料污染的重要訊號。

重要澄清:Greenblatt 強調這些發現不能直接證明蒸餾發生——身份混淆也可能來自訓練資料污染、系統提示詞洩漏或公開資料集合樣本。但結合 Anthropic 2 月指控與統計規律性,這是迄今比「白宮喊話」更紮實的技術支撐。

痛點開發者選型時的隱性成本與合規風險

  • API 帳單 vs 算力帳單:Opus 5 半價逼近旗艦,但若 Agent 跑在共享 VPS 或桌下 Mac 上,佇列抖動與長連線中斷會迅速吃掉 token 降價收益。
  • 合規與供應鏈:Fable 5 / Mythos 5 的 30 天資料留存政策對金融、醫療場景是硬門檻;K3 的蒸餾指控則帶來出口管制與政策不確定性。
  • 開源驗證窗口:K3 完整權重 7 月 27 日前,所有架構與跑分僅為「官方自評 + 外部猜測」,生產接入存在資訊不對稱。
  • 模型路由複雜度:多模型 Fallback(Opus 5 + K3 + 本地推理)需要穩定 CI 與 Agent 宿主,而非僅換 API Key。

04六步 Runbook:本週模型更新後的生產接入

  1. 01
    稽核現有 Claude 呼叫:檢查是否仍指向 Opus 4.8 或 Fable 5;Claude Max 使用者確認控制台已切換至 Opus 5 預設。
  2. 02
    跑 CursorBench / 內部基準冒煙:在 high / max effort 檔位對比 Opus 5 與 Fable 5 在你真實程式碼庫上的通過率與 token 消耗。
  3. 03
    評估資料留存條款:合規敏感場景優先 Opus 5(無強制留存);若需 Fable 5 峰值能力,單獨評估 30 天留存政策影響。
  4. 04
    暫緩 K3 生產接入:等待 7 月 27 日權重釋出後,獨立複現 GPQA-Diamond / SWE Marathon 等基準,並執行 Greenblatt 式身份探針測試。
  5. 05
    設定多模型路由:經 OpenRouter 或 LiteLLM 設定 Opus 5 主路由 + 開源 Fallback,並記錄每次呼叫的模型 ID 與成本。
  6. 06
    部署穩定 Agent 宿主:長時 Agent 會話需要獨佔算力與穩定 SSH。對照 定價頁 評估 NUKCLOUD 獨佔 Mac 節點作為 CI 與 Agent 建置平面,避免共享池尾延遲吞噬 API 成本優勢。

05兩件事放在一起看:性價比才是主戰場

Opus 5 以「半價逼近旗艦」回應市場對性價比的訴求;Kimi K3 以「開源 + 低價 + 少拒答」衝擊市場;圍繞 K3 的爭議,本質上是各家在性價比戰爭裡對「你的低價是靠技術優化還是白嫖別人模型」的公開攤牌。

對一般開發者:先看場景,再看立場。合規、資料留存、供應鏈敏感 → Opus 5 性價比極高;極限成本與開源可控 → 等 7 月 27 日 K3 權重實測後再決策。Reddit r/LocalLLaMA 上三方聲音並存:歡呼開源閉源差距縮短到「天」而非「月」;調侃 2.8T 參數本地跑不動;務實派認為 K3 真正賣點是低價 + 無審查,而非「打敗 Fable 5」。

團隊用 Opus 5 或 K3 驅動長時 Agent 對大型程式碼庫呼叫時,仍需要穩定、可稽核的本地開發與 CI 平面。共享分鐘池、桌下 Mac 或超賣 VPS 上的頻寬抖動、鄰居 CPU 爭搶與長連線中斷,會迅速吃掉 Token 降價帶來的收益。對更穩定的生產 Agent 主機,NUKCLOUD 多區域裸金屬 Mac / 雲端 Mac 節點提供獨佔 Apple Silicon 算力與清晰租戶邊界,可在 定價頁 對照規格並經 下單頁 試跑。

06總結與 FAQ

Claude Opus 5 比 Claude Fable 5 便宜多少?
Opus 5 輸入 $5/M、輸出 $25/M,約為 Fable 5($10/$50 量級)的一半;CursorBench 3.2 峰值成績相差不到 1%。
Claude Opus 5 現在是 Claude Max 的預設模型嗎?
是的,2026 年 7 月 24 日發布當天起 Opus 5 成為 Claude Max 預設模型,也是 Claude Pro 使用者可用的最強版本。
Kimi K3 真的蒸餾了 Claude 嗎?
截至本文發布,這仍是有爭議、尚未被最終證實的指控。白宮缺乏公開證據,專家從時間軸角度質疑兩週內完成深度蒸餾;Ryan Greenblatt 發現的「K3 自稱 Claude 並洩漏內部版本號」是目前最具技術含量的間接證據。
Kimi K3 的完整權重什麼時候能下載?
官方承諾 2026 年 7 月 27 日,本文發布時外部研究者尚無法完全獨立驗證架構與跑分。
為什麼 Kimi K3 會自稱 Claude?
Greenblatt 統計分析顯示 K3 會吐出 claude-opus-4-5-20250929 等內部部署 ID,比真正的 Claude 模型自己報得還準,可能指向訓練資料混入了帶部署中繼資料標註的 Claude API 日誌或合成資料。
Agent CI 應跑在什麼基礎設施上?
長時 Agent 需要穩定 SSH、可預測磁碟 IO 與無鄰居爭搶算力。NUKCLOUD 獨佔 Mac 節點適合作為 Agent 宿主與 CI 建置平面。

資料截至 2026-07-25。來源:Anthropic 官方發布、Moonshot/Kimi 技術博客、TechCrunch、Ryan Greenblatt GitHub、CNBC、The Verge。