Kimi K3 是開源嗎?深度解析月之暗面 2.8 兆參數開放權重全面公開

7 月 27 日晚 23 點左右,月之暗面正式發布 Kimi K3 完整模型權重與技術報告,並同步開源 MoonEP、FlashKDA、AgentEnv 三項核心基礎設施——全球首個完整開放的 3 兆參數級別模型,Hugging Face 權重約 1.56TB,上線半小時登頂趨勢榜第一。

一句話結論: Kimi K3 在 API 首發僅 11 天 後即開放完整權重——2.8T MoE、1M token 上下文、原生視覺理解,並附帶 MoonEP / FlashKDA / AgentEnv 工程棧。但官方用詞是 open weight(開放權重) 而非 OSI 意義上的「開源」;許可證新增 $2000 萬 MaaS 收入1 億 MAU 兩道商業門檻。本文嚴格對照 7 月 16 日 K3 首發評測蒸餾門爭議OpenRouter 7 月排行,涵蓋時間線、架構、跑分、許可、API 定價、六步 Runbook 與 FAQ。

00時間線:從 API 首發到全面開放,只用了 11 天

  • 7 月 16 日夜(WAIC 2026 前夜): Kimi K3 在 kimi.com、Kimi Work、Kimi Code 與 Kimi API 首發,權重尚未公開。官方技術部落格標題為《Kimi K3: Open Frontier Intelligence》。
  • 7 月 17 日: 業界密集分析架構;新華社報導稱其為「目前全球參數最大的開源模型」。
  • 7 月 22–23 日: 中美「模型蒸餾」爭端升級。白宮科技顧問 Michael Kratsios 指控月之暗面對 Anthropic Fable 模型進行「大規模、隱蔽的工業化蒸餾」;美國財政部長 Scott Bessent 表示將考慮制裁及「實體清單」限制。
  • 7 月 27 日晚 23 點: 月之暗面發布 K3 完整權重、技術報告,並開源 MoonEP、AgentEnv(FlashKDA 此前已開源)。
  • 7 月 28 日: 中國商務部公開回應,指責美方搞「AI 霸權主義」並威脅反制;國內媒體跟進報導開源細節。
可引用三數: ① 總參數 2.8T,激活約 1040 億;② 上下文 100 萬 token;③ Hugging Face 權重體積約 1.56TB,半小時登頂趨勢榜第一。

01Kimi K3 核心參數一覽

項目參數
總參數量2.8 兆(2.8T)
激活參數量約 1040 億
架構類型混合專家模型(MoE)
專家配置896 個路由專家,每 token 激活 16 個(另有共享專家)
注意力機制Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA)
上下文視窗100 萬 token
多模態能力原生視覺理解(ViT-V2,27 層)
權重格式MXFP4 權重 + MXFP8 激活(SFT 階段起量化感知訓練)
權重體積約 1.56TB(Hugging Face)
License自訂許可證(官方稱 open weight,非 open source)

痛點企業選型時容易被忽略的隱性成本

  • 「開源」語意落差: 國內媒體普遍寫「開源」,但 Moonshot 材料從未使用 open source,僅稱 open weight——訓練資料與完整訓練程式碼未公開,不符合 OSI 定義。
  • 許可證兩道門檻: MaaS 業務連續 12 個月收入超 $2000 萬須另行簽約;月活超 1 億或月收入超 $2000 萬須顯著展示「Kimi K3」字樣——競品 API 服務商需法務重點審查。
  • 自部署現實門檻: 896 專家、2.8T 規模決定 K3 無法在消費級硬體運行,官方建議 64 卡及以上超節點——權重下載不等於可本地跑通。
  • 輸出單價: 輸出 $15/M,高於開源陣營 GLM-5.2(約 $0.47/任務 Intelligence Index 口徑),屬於能力天花板而非性價比首選。
  • 蒸餾爭議未消: 權重公開並未終結 白宮指控與 K3 自稱 Claude 的獨立研究發現,企業合規審查仍需獨立評估。
  • 1.56TB 下載與儲存: 權重拉取、校驗、多副本儲存對頻寬與物件儲存預算是一次性硬成本,遠超市面「改 base URL 就能用」的敘事。

02三大架構創新:KDA、AttnRes 與 Per-Head Muon

Kimi Delta Attention(KDA)

傳統 Gated DeltaNet 使用標量級遺忘門;KDA 改為逐通道門控,每個特徵維度獨立衰減率,某些特徵長期保留、另一些快速遺忘。採用 chunkwise Diagonal-Plus-Low-Rank(DPLR)公式實現線性時間遞迴,K3 將 KDA 與少量 Gated MLA 全域注意力層交替混合——支撐 100 萬 token 上下文同時壓低 KV Cache 開銷的核心原因。

Attention Residuals(AttnRes)

傳統殘差連接逐層均勻累加,深層易稀釋早期層資訊。AttnRes 改為選擇性、依據輸入動態聚合前面所有層輸出,每層僅新增一個 RMSNorm 與一個偽查詢向量,帶來約 25% 訓練效率提升,代價不足 2%。偽查詢向量初始化為零,訓練初期等價於均勻平均。

Per-Head Muon 與 Stable LatentMoE

Muon 優化器擴展為逐注意力頭獨立優化,純訓練期技術,API 呼叫無感知。MoE 層 896 選 16(稀疏度約 1.8%),配合 Quantile Balancing 與 MoonEP 從數學上證明冗餘專家數理論上界,保證負載均衡可行性。

03三大開源 Infra:MoonEP、FlashKDA、AgentEnv

技術定位關鍵能力
MoonEP超大規模細粒度 MoE 高效能通訊庫臨時複製過載專家,保證每節點均等 token 數;證明冗餘專家數理論上界
FlashKDACUTLASS 實現的 KDA 高效能算子(此前已開源)H20 上 prefill 較 flash-linear-attention 基線快 1.72–2.22 倍;可作為 chunk_kda 直接替代後端
AgentEnv與 KVCache.ai 聯合開發的 Agent 沙箱(Firecracker microVM)大規模並行 Agent RL;官方披露 checkpoint 延遲低至 133ms、恢復 49ms、記憶體超分最高 6.5 倍(尚未第三方獨立復現)

月之暗面此次不只釋出權重檔案,而是把支撐訓練效率與穩定性的工程能力一併公開——這也是開發社群評價較高的重要原因。

04跑分對比:GPT-5.6、Claude 與 GLM-5.2

以下優先引用獨立第三方復測;廠商自報資料僅作補充。

模型SWE-bench Verified(Vals AI)發布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 智能指數(max 推理檔): Claude Fable 5 60、GPT-5.6 Sol 59、Kimi K3 約 57(全球第 3,開放權重第 1)、GLM-5.2 51、DeepSeek V4 Pro 44。K3 每任務成本約 $0.95,比 Fable 5(約 $2.4)便宜約 60%,但高於 GLM-5.2(約 $0.47)。它是開放權重陣營能力天花板,而非性價比最優。 目前在 Arena.ai Frontend Code Arena 榜單排名第一。

DeepSeek V4 滿血版 對比:V4 在成本與峰谷計費上更友好,K3 在綜合能力與 1M 上下文上領先。

05是「開源」還是「開放權重」?許可證兩道商業門檻

月之暗面官方材料從未使用 open source,一直採用 open weight 表述。按 OSI 標準,真正開源需公開訓練資料、訓練程式碼與可復現流程;K3 僅公開訓練後權重、技術報告與推理相關 Infra,訓練資料與完整訓練程式碼未公開。

許可證也不再自稱 Modified MIT(K2 時代說法),而是一份完全自訂文件,含兩道 K2 系列沒有的商業門檻:

  1. Model-as-a-Service 收入門檻: 被許可方及關聯方營運 MaaS 業務,連續 12 個月累計收入超過 $2000 萬,須與月之暗面另行簽署商業協議。
  2. 規模展示門檻: 產品月活超過 1 億,或月收入超過 $2000 萬,須在介面顯著展示「Kimi K3」字樣。

對絕大多數中小團隊與新創公司,兩道門檻幾乎不會觸發;若商業計畫是「拿 K3 開與月之暗面競爭的模型服務」,第一道門檻是法務紅線。

06API 定價與自部署:能不能自己跑?

Token 類型價格(每百萬 token)
輸入(快取命中)$0.30
輸入(快取未命中)$3.00
輸出(含推理過程)$15.00

Moonshot 提供 OpenAI SDK 相容 API(https://api.moonshot.ai/v1,模型 ID kimi-k3)。Mooncake 分離式推理在典型程式設計負載上快取命中率可達 90%+,實際成本更接近 $0.30 檔而非 $3 表頭價。

自部署需 64 卡及以上超節點;個人與中小團隊更現實路徑是透過官方 API 或 OpenRouter(已有 7 家服務商,定價大多與官方一致)。若需在 Apple Silicon 上跑較小開源 MoE,可參考本站 DeepSeek V4 高記憶體 Mac 租賃 Runbook

07WAIC 2026 與中美 AI 競賽背景

Kimi K3 開放權重節點卡在 WAIC 2026 窗口期,疊加升級中的中美「模型蒸餾」爭端。權重開源前幾天美方指控月之暗面工業化蒸餾 Anthropic 模型訓練 K3 並威脅制裁;7 月 28 日中國商務部指責美方「AI 霸權主義」並威脅反制。在此背景下全面公開權重、技術報告與三項 Infra,是用工程細節自證技術路徑獨立性的態度表達。三天後阿里巴巴發布 24 兆參數 Qwen3.8-Max-Preview,被外界解讀為對 K3 的直接回應,國產大模型競爭進入「3T 俱樂部」階段。

08六步 Runbook:Kimi K3 開放權重上手

  1. 01
    確認許可邊界:閱讀自訂 License,判斷 MaaS 收入與 MAU 是否觸及 $2000 萬 / 1 億門檻;競品推理服務商須法務先行審查。
  2. 02
    選擇接入路徑:API 改 base URL 至 https://api.moonshot.ai/v1;或 OpenRouter moonshotai/kimi-k3;自部署僅適合有 64+ 卡超節點的團隊。
  3. 03
    設計快取友好 Prompt:穩定 system prompt 與前綴塊,讓 Mooncake 命中 $0.30/M 快取檔,程式設計場景目標 90%+ 命中率。
  4. 04
    小規模冒煙測試:先用 1 萬 token 級任務驗證品質與延遲,對照 OpenRouter 7 月排行 確認路由策略。
  5. 05
    權重下載規劃:若需本地微調,預留 1.56TB+ 儲存與頻寬;校驗 Hugging Face 檔案完整性後再啟動訓練流水線。
  6. 06
    建立混合路由與成本模型:長程程式設計與文件分析走 K3;FrontierSWE 級修 Bug 保留 Fable 5;對照 定價頁 估算 Agent CI 基礎設施月度成本後再放量。

09總結與 FAQ

Kimi K3 全面開放權重是 2026 年開放權重賽道最重要的事件之一:2.8T 規模、1M 上下文、完整 Infra 棧與 Artificial Analysis 全球第三的智能指數,證明中國實驗室在工程創新上可與閉源前沿同台。但 open weight 不等於 open source,許可證與蒸餾爭議要求企業用戶保持清醒。

團隊用 K3 驅動 Agent 對大型程式碼庫長時呼叫時,仍需要穩定、可審計的本地開發與 CI 平面。共享分鐘池、桌下 Mac 或超賣 VPS 上的頻寬抖動、鄰居 CPU 爭搶與長連線中斷,會迅速吃掉 Token 降價帶來的收益。對更穩定的生產 Agent 主機與建置環境,NUKCLOUD 多區域裸金屬 Mac / 雲端 Mac 節點提供獨占 Apple Silicon 算力與清晰租戶邊界,可在 定價頁 對照規格並經 下單頁 試跑。

Kimi K3 真的是開源模型嗎?
嚴格來說不是。它屬於開放權重模型:權重、技術報告和部分 Infra 公開,訓練資料與完整訓練程式碼未公開,不符合 OSI「開源」定義。
Kimi K3 可以免費商用嗎?
可以,絕大多數商業場景不受限制。MaaS 年收入超 $2000 萬或月活超 1 億/月收入超 $2000 萬須滿足許可證特定條款。
Kimi K3 需要多少顯卡才能自己部署?
官方建議 64 卡及以上超節點。個人與大部分企業更現實的方式是官方 API 或 OpenRouter。
Kimi K3 的效能到底強不強?
開放權重陣營綜合能力最強,Artificial Analysis 全球第 3;但成本高於 GLM-5.2,屬能力天花板而非性價比最優。
Kimi K3 和 Kimi K2 有什麼區別?
K3 參數約為 K2.5 的 3 倍,新增 AttnRes 與 Per-Head Muon,上下文與多模態大幅提升;許可證新增 MaaS 收入門檻。
Agent CI 應跑在什麼基礎設施上?
長時 K3 Agent 會話需要穩定 SSH 與無鄰居爭搶的算力。NUKCLOUD 獨占 Mac 節點適合作為 Agent 宿主與 CI 建置平面。

資料截至 2026-07-28。來源:Moonshot AI 官方部落格、Hugging Face、Vals AI SWE-bench、Artificial Analysis Intelligence Index、VentureBeat、Scientific American。發布前請以官方最新資料為準。