一句話結論: Kimi K3 在 API 首發僅 11 天 後即開放完整權重——2.8T MoE、1M token 上下文、原生視覺理解,並附帶 MoonEP / FlashKDA / AgentEnv 工程棧。但官方用詞是 open weight(開放權重) 而非 OSI 意義上的「開源」;許可證新增 $2000 萬 MaaS 收入 與 1 億 MAU 兩道商業門檻。本文嚴格對照 7 月 16 日 K3 首發評測、蒸餾門爭議與 OpenRouter 7 月排行,涵蓋時間線、架構、跑分、許可、API 定價、六步 Runbook 與 FAQ。
00時間線:從 API 首發到全面開放,只用了 11 天
- 7 月 16 日夜(WAIC 2026 前夜): Kimi K3 在 kimi.com、Kimi Work、Kimi Code 與 Kimi API 首發,權重尚未公開。官方技術部落格標題為《Kimi K3: Open Frontier Intelligence》。
- 7 月 17 日: 業界密集分析架構;新華社報導稱其為「目前全球參數最大的開源模型」。
- 7 月 22–23 日: 中美「模型蒸餾」爭端升級。白宮科技顧問 Michael Kratsios 指控月之暗面對 Anthropic Fable 模型進行「大規模、隱蔽的工業化蒸餾」;美國財政部長 Scott Bessent 表示將考慮制裁及「實體清單」限制。
- 7 月 27 日晚 23 點: 月之暗面發布 K3 完整權重、技術報告,並開源 MoonEP、AgentEnv(FlashKDA 此前已開源)。
- 7 月 28 日: 中國商務部公開回應,指責美方搞「AI 霸權主義」並威脅反制;國內媒體跟進報導開源細節。
01Kimi K3 核心參數一覽
| 項目 | 參數 |
|---|---|
| 總參數量 | 2.8 兆(2.8T) |
| 激活參數量 | 約 1040 億 |
| 架構類型 | 混合專家模型(MoE) |
| 專家配置 | 896 個路由專家,每 token 激活 16 個(另有共享專家) |
| 注意力機制 | Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA) |
| 上下文視窗 | 100 萬 token |
| 多模態能力 | 原生視覺理解(ViT-V2,27 層) |
| 權重格式 | MXFP4 權重 + MXFP8 激活(SFT 階段起量化感知訓練) |
| 權重體積 | 約 1.56TB(Hugging Face) |
| License | 自訂許可證(官方稱 open weight,非 open source) |
痛點企業選型時容易被忽略的隱性成本
- 「開源」語意落差: 國內媒體普遍寫「開源」,但 Moonshot 材料從未使用 open source,僅稱 open weight——訓練資料與完整訓練程式碼未公開,不符合 OSI 定義。
- 許可證兩道門檻: MaaS 業務連續 12 個月收入超 $2000 萬須另行簽約;月活超 1 億或月收入超 $2000 萬須顯著展示「Kimi K3」字樣——競品 API 服務商需法務重點審查。
- 自部署現實門檻: 896 專家、2.8T 規模決定 K3 無法在消費級硬體運行,官方建議 64 卡及以上超節點——權重下載不等於可本地跑通。
- 輸出單價: 輸出 $15/M,高於開源陣營 GLM-5.2(約 $0.47/任務 Intelligence Index 口徑),屬於能力天花板而非性價比首選。
- 蒸餾爭議未消: 權重公開並未終結 白宮指控與 K3 自稱 Claude 的獨立研究發現,企業合規審查仍需獨立評估。
- 1.56TB 下載與儲存: 權重拉取、校驗、多副本儲存對頻寬與物件儲存預算是一次性硬成本,遠超市面「改 base URL 就能用」的敘事。
02三大架構創新:KDA、AttnRes 與 Per-Head Muon
Kimi Delta Attention(KDA)
傳統 Gated DeltaNet 使用標量級遺忘門;KDA 改為逐通道門控,每個特徵維度獨立衰減率,某些特徵長期保留、另一些快速遺忘。採用 chunkwise Diagonal-Plus-Low-Rank(DPLR)公式實現線性時間遞迴,K3 將 KDA 與少量 Gated MLA 全域注意力層交替混合——支撐 100 萬 token 上下文同時壓低 KV Cache 開銷的核心原因。
Attention Residuals(AttnRes)
傳統殘差連接逐層均勻累加,深層易稀釋早期層資訊。AttnRes 改為選擇性、依據輸入動態聚合前面所有層輸出,每層僅新增一個 RMSNorm 與一個偽查詢向量,帶來約 25% 訓練效率提升,代價不足 2%。偽查詢向量初始化為零,訓練初期等價於均勻平均。
Per-Head Muon 與 Stable LatentMoE
Muon 優化器擴展為逐注意力頭獨立優化,純訓練期技術,API 呼叫無感知。MoE 層 896 選 16(稀疏度約 1.8%),配合 Quantile Balancing 與 MoonEP 從數學上證明冗餘專家數理論上界,保證負載均衡可行性。
03三大開源 Infra:MoonEP、FlashKDA、AgentEnv
| 技術 | 定位 | 關鍵能力 |
|---|---|---|
| MoonEP | 超大規模細粒度 MoE 高效能通訊庫 | 臨時複製過載專家,保證每節點均等 token 數;證明冗餘專家數理論上界 |
| FlashKDA | CUTLASS 實現的 KDA 高效能算子(此前已開源) | H20 上 prefill 較 flash-linear-attention 基線快 1.72–2.22 倍;可作為 chunk_kda 直接替代後端 |
| AgentEnv | 與 KVCache.ai 聯合開發的 Agent 沙箱(Firecracker microVM) | 大規模並行 Agent RL;官方披露 checkpoint 延遲低至 133ms、恢復 49ms、記憶體超分最高 6.5 倍(尚未第三方獨立復現) |
月之暗面此次不只釋出權重檔案,而是把支撐訓練效率與穩定性的工程能力一併公開——這也是開發社群評價較高的重要原因。
04跑分對比:GPT-5.6、Claude 與 GLM-5.2
以下優先引用獨立第三方復測;廠商自報資料僅作補充。
| 模型 | SWE-bench Verified(Vals AI) | 發布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指數(max 推理檔): Claude Fable 5 60、GPT-5.6 Sol 59、Kimi K3 約 57(全球第 3,開放權重第 1)、GLM-5.2 51、DeepSeek V4 Pro 44。K3 每任務成本約 $0.95,比 Fable 5(約 $2.4)便宜約 60%,但高於 GLM-5.2(約 $0.47)。它是開放權重陣營能力天花板,而非性價比最優。 目前在 Arena.ai Frontend Code Arena 榜單排名第一。
與 DeepSeek V4 滿血版 對比:V4 在成本與峰谷計費上更友好,K3 在綜合能力與 1M 上下文上領先。
05是「開源」還是「開放權重」?許可證兩道商業門檻
月之暗面官方材料從未使用 open source,一直採用 open weight 表述。按 OSI 標準,真正開源需公開訓練資料、訓練程式碼與可復現流程;K3 僅公開訓練後權重、技術報告與推理相關 Infra,訓練資料與完整訓練程式碼未公開。
許可證也不再自稱 Modified MIT(K2 時代說法),而是一份完全自訂文件,含兩道 K2 系列沒有的商業門檻:
- Model-as-a-Service 收入門檻: 被許可方及關聯方營運 MaaS 業務,連續 12 個月累計收入超過 $2000 萬,須與月之暗面另行簽署商業協議。
- 規模展示門檻: 產品月活超過 1 億,或月收入超過 $2000 萬,須在介面顯著展示「Kimi K3」字樣。
對絕大多數中小團隊與新創公司,兩道門檻幾乎不會觸發;若商業計畫是「拿 K3 開與月之暗面競爭的模型服務」,第一道門檻是法務紅線。
06API 定價與自部署:能不能自己跑?
| Token 類型 | 價格(每百萬 token) |
|---|---|
| 輸入(快取命中) | $0.30 |
| 輸入(快取未命中) | $3.00 |
| 輸出(含推理過程) | $15.00 |
Moonshot 提供 OpenAI SDK 相容 API(https://api.moonshot.ai/v1,模型 ID kimi-k3)。Mooncake 分離式推理在典型程式設計負載上快取命中率可達 90%+,實際成本更接近 $0.30 檔而非 $3 表頭價。
自部署需 64 卡及以上超節點;個人與中小團隊更現實路徑是透過官方 API 或 OpenRouter(已有 7 家服務商,定價大多與官方一致)。若需在 Apple Silicon 上跑較小開源 MoE,可參考本站 DeepSeek V4 高記憶體 Mac 租賃 Runbook。
07WAIC 2026 與中美 AI 競賽背景
Kimi K3 開放權重節點卡在 WAIC 2026 窗口期,疊加升級中的中美「模型蒸餾」爭端。權重開源前幾天美方指控月之暗面工業化蒸餾 Anthropic 模型訓練 K3 並威脅制裁;7 月 28 日中國商務部指責美方「AI 霸權主義」並威脅反制。在此背景下全面公開權重、技術報告與三項 Infra,是用工程細節自證技術路徑獨立性的態度表達。三天後阿里巴巴發布 24 兆參數 Qwen3.8-Max-Preview,被外界解讀為對 K3 的直接回應,國產大模型競爭進入「3T 俱樂部」階段。
08六步 Runbook:Kimi K3 開放權重上手
-
01
確認許可邊界:閱讀自訂 License,判斷 MaaS 收入與 MAU 是否觸及 $2000 萬 / 1 億門檻;競品推理服務商須法務先行審查。
-
02
選擇接入路徑:API 改 base URL 至
https://api.moonshot.ai/v1;或 OpenRoutermoonshotai/kimi-k3;自部署僅適合有 64+ 卡超節點的團隊。 -
03
設計快取友好 Prompt:穩定 system prompt 與前綴塊,讓 Mooncake 命中 $0.30/M 快取檔,程式設計場景目標 90%+ 命中率。
-
04
小規模冒煙測試:先用 1 萬 token 級任務驗證品質與延遲,對照 OpenRouter 7 月排行 確認路由策略。
-
05
權重下載規劃:若需本地微調,預留 1.56TB+ 儲存與頻寬;校驗 Hugging Face 檔案完整性後再啟動訓練流水線。
-
06
建立混合路由與成本模型:長程程式設計與文件分析走 K3;FrontierSWE 級修 Bug 保留 Fable 5;對照 定價頁 估算 Agent CI 基礎設施月度成本後再放量。
09總結與 FAQ
Kimi K3 全面開放權重是 2026 年開放權重賽道最重要的事件之一:2.8T 規模、1M 上下文、完整 Infra 棧與 Artificial Analysis 全球第三的智能指數,證明中國實驗室在工程創新上可與閉源前沿同台。但 open weight 不等於 open source,許可證與蒸餾爭議要求企業用戶保持清醒。
團隊用 K3 驅動 Agent 對大型程式碼庫長時呼叫時,仍需要穩定、可審計的本地開發與 CI 平面。共享分鐘池、桌下 Mac 或超賣 VPS 上的頻寬抖動、鄰居 CPU 爭搶與長連線中斷,會迅速吃掉 Token 降價帶來的收益。對更穩定的生產 Agent 主機與建置環境,NUKCLOUD 多區域裸金屬 Mac / 雲端 Mac 節點提供獨占 Apple Silicon 算力與清晰租戶邊界,可在 定價頁 對照規格並經 下單頁 試跑。
資料截至 2026-07-28。來源:Moonshot AI 官方部落格、Hugging Face、Vals AI SWE-bench、Artificial Analysis Intelligence Index、VentureBeat、Scientific American。發布前請以官方最新資料為準。