一句话结论: Kimi K3 在 API 首发仅 11 天 后即开放完整权重——2.8T MoE、1M token 上下文、原生视觉理解,并附带 MoonEP / FlashKDA / AgentEnv 工程栈。但官方用词是 open weight(开放权重) 而非 OSI 意义上的「开源」;许可证新增 $2000 万 MaaS 收入 与 1 亿 MAU 两道商业门槛。本文严格对照 7 月 16 日 K3 首发评测、蒸馏门争议与 OpenRouter 7 月排行,覆盖时间线、架构、跑分、许可、API 定价、六步 Runbook 与 FAQ。
00时间线:从 API 首发到全面开源,只用了 11 天
- 7 月 16 日夜(WAIC 2026 前夜): Kimi K3 在 kimi.com、Kimi Work、Kimi Code 与 Kimi API 首发,权重尚未公开。官方技术博客标题为《Kimi K3: Open Frontier Intelligence》。
- 7 月 17 日: 行业密集分析架构;新华社报道称其为「目前全球参数最大的开源模型」。
- 7 月 22–23 日: 中美「模型蒸馏」争端升级。白宫科技顾问 Michael Kratsios 指控月之暗面对 Anthropic Fable 模型进行「大规模、隐蔽的工业化蒸馏」;美国财政部长 Scott Bessent 表示将考虑制裁及「实体清单」限制。
- 7 月 27 日晚 23 点: 月之暗面发布 K3 完整权重、技术报告,并开源 MoonEP、AgentEnv(FlashKDA 此前已开源)。
- 7 月 28 日: 中国商务部公开回应,指责美方搞「AI 霸权主义」并威胁反制;国内媒体跟进报道开源细节。
01Kimi K3 核心参数一览
| 项目 | 参数 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 激活参数量 | 约 1040 亿 |
| 架构类型 | 混合专家模型(MoE) |
| 专家配置 | 896 个路由专家,每 token 激活 16 个(另有共享专家) |
| 注意力机制 | Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA) |
| 上下文窗口 | 100 万 token |
| 多模态能力 | 原生视觉理解(ViT-V2,27 层) |
| 权重格式 | MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练) |
| 权重体积 | 约 1.56TB(Hugging Face) |
| License | 自定义许可证(官方称 open weight,非 open source) |
痛点企业选型时容易被忽略的隐性成本
- 「开源」语义落差: 国内媒体普遍写「开源」,但 Moonshot 材料从未使用 open source,仅称 open weight——训练数据与完整训练代码未公开,不符合 OSI 定义。
- 许可证两道门槛: MaaS 业务连续 12 个月收入超 $2000 万须另行签约;月活超 1 亿或月收入超 $2000 万须显著展示「Kimi K3」字样——竞品 API 服务商需法务重点审查。
- 自部署现实门槛: 896 专家、2.8T 规模决定 K3 无法在消费级硬件运行,官方建议 64 卡及以上超节点——权重下载不等于可本地跑通。
- 输出单价: 输出 $15/M,高于开源阵营 GLM-5.2(约 $0.47/任务 Intelligence Index 口径),属于能力天花板而非性价比首选。
- 蒸馏争议未消: 权重公开并未终结 白宫指控与 K3 自称 Claude 的独立研究发现,企业合规审查仍需独立评估。
- 1.56TB 下载与存储: 权重拉取、校验、多副本存储对带宽与对象存储预算是一次性硬成本,远超市面「改 base URL 就能用」的叙事。
02三大架构创新:KDA、AttnRes 与 Per-Head Muon
Kimi Delta Attention(KDA)
传统 Gated DeltaNet 使用标量级遗忘门;KDA 改为逐通道门控,每个特征维度独立衰减率,某些特征长期保留、另一些快速遗忘。采用 chunkwise Diagonal-Plus-Low-Rank(DPLR)公式实现线性时间递归,K3 将 KDA 与少量 Gated MLA 全局注意力层交替混合——支撑 100 万 token 上下文同时压低 KV Cache 开销的核心原因。
Attention Residuals(AttnRes)
传统残差连接逐层均匀累加,深层易稀释早期层信息。AttnRes 改为选择性、依据输入动态聚合前面所有层输出,每层仅新增一个 RMSNorm 与一个伪查询向量,带来约 25% 训练效率提升,代价不足 2%。伪查询向量初始化为零,训练初期等价于均匀平均。
Per-Head Muon 与 Stable LatentMoE
Muon 优化器扩展为逐注意力头独立优化,纯训练期技术,API 调用无感知。MoE 层 896 选 16(稀疏度约 1.8%),配合 Quantile Balancing 与 MoonEP 从数学上证明冗余专家数理论上界,保证负载均衡可行性。
03三大开源 Infra:MoonEP、FlashKDA、AgentEnv
| 技术 | 定位 | 关键能力 |
|---|---|---|
| MoonEP | 超大规模细粒度 MoE 高性能通信库 | 临时复制过载专家,保证每节点均等 token 数;证明冗余专家数理论上界 |
| FlashKDA | CUTLASS 实现的 KDA 高性能算子(此前已开源) | H20 上 prefill 较 flash-linear-attention 基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端 |
| AgentEnv | 与 KVCache.ai 联合开发的 Agent 沙箱(Firecracker microVM) | 大规模并行 Agent RL;官方披露 checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍(尚未第三方独立复现) |
月之暗面此次不只甩权重文件,而是把支撑训练效率与稳定性的工程能力一并公开——这也是开发社区评价较高的重要原因。
04跑分对比:GPT-5.6、Claude 与 GLM-5.2
以下优先引用独立第三方复测;厂商自报数据仅作补充。
| 模型 | SWE-bench Verified(Vals AI) | 发布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指数(max 推理档): Claude Fable 5 60、GPT-5.6 Sol 59、Kimi K3 约 57(全球第 3,开放权重第 1)、GLM-5.2 51、DeepSeek V4 Pro 44。K3 每任务成本约 $0.95,比 Fable 5(约 $2.4)便宜约 60%,但高于 GLM-5.2(约 $0.47)。它是开放权重阵营能力天花板,而非性价比最优。 目前在 Arena.ai Frontend Code Arena 榜单排名第一。
与 DeepSeek V4 满血版 对比:V4 在成本与峰谷计费上更友好,K3 在综合能力与 1M 上下文上领先。
05是「开源」还是「开放权重」?许可证两道商业门槛
月之暗面官方材料从未使用 open source,一直采用 open weight 表述。按 OSI 标准,真正开源需公开训练数据、训练代码与可复现流程;K3 仅公开训练后权重、技术报告与推理相关 Infra,训练数据与完整训练代码未公开。
许可证也不再自称 Modified MIT(K2 时代说法),而是一份完全自定义文件,含两道 K2 系列没有的商业门槛:
- Model-as-a-Service 收入门槛: 被许可方及关联方运营 MaaS 业务,连续 12 个月累计收入超过 $2000 万,须与月之暗面另行签署商业协议。
- 规模展示门槛: 产品月活超过 1 亿,或月收入超过 $2000 万,须在界面显著展示「Kimi K3」字样。
对绝大多数中小团队与创业公司,两道门槛几乎不会触发;若商业计划是「拿 K3 开与月之暗面竞争的模型服务」,第一道门槛是法务红线。
06API 定价与自部署:能不能自己跑?
| Token 类型 | 价格(每百万 token) |
|---|---|
| 输入(缓存命中) | $0.30 |
| 输入(缓存未命中) | $3.00 |
| 输出(含推理过程) | $15.00 |
Moonshot 提供 OpenAI SDK 兼容 API(https://api.moonshot.ai/v1,模型 ID kimi-k3)。Mooncake 分离式推理在典型编程负载上缓存命中率可达 90%+,实际成本更接近 $0.30 档而非 $3 表头价。
自部署需 64 卡及以上超节点;个人与中小团队更现实路径是通过官方 API 或 OpenRouter(已有 7 家服务商,定价大多与官方一致)。若需在 Apple Silicon 上跑较小开源 MoE,可参考本站 DeepSeek V4 高内存 Mac 租赁 Runbook。
07WAIC 2026 与中美 AI 竞赛背景
Kimi K3 开源节点卡在 WAIC 2026 窗口期,叠加升级中的中美「模型蒸馏」争端。权重开源前几天美方指控月之暗面工业化蒸馏 Anthropic 模型训练 K3 并威胁制裁;7 月 28 日中国商务部指责美方「AI 霸权主义」并威胁反制。在此背景下全面公开权重、技术报告与三项 Infra,是用工程细节自证技术路径独立性的态度表达。三天后阿里巴巴发布 24 万亿参数 Qwen3.8-Max-Preview,被外界解读为对 K3 的直接回应,国产大模型竞争进入「3T 俱乐部」阶段。
08六步 Runbook:Kimi K3 开放权重上手
-
01
确认许可边界:阅读自定义 License,判断 MaaS 收入与 MAU 是否触及 $2000 万 / 1 亿门槛;竞品推理服务商须法务先行审查。
-
02
选择接入路径:API 改 base URL 至
https://api.moonshot.ai/v1;或 OpenRoutermoonshotai/kimi-k3;自部署仅适合有 64+ 卡超节点的团队。 -
03
设计缓存友好 Prompt:稳定 system prompt 与前缀块,让 Mooncake 命中 $0.30/M 缓存档,编程场景目标 90%+ 命中率。
-
04
小规模冒烟测试:先用 1 万 token 级任务验证质量与延迟,对照 OpenRouter 7 月排行 确认路由策略。
-
05
权重下载规划:若需本地微调,预留 1.56TB+ 存储与带宽;校验 Hugging Face 文件完整性后再启动训练流水线。
-
06
建立混合路由与成本模型:长程编程与文档分析走 K3;FrontierSWE 级修 Bug 保留 Fable 5;对照 定价页 估算 Agent CI 基础设施月度成本后再放量。
09总结与 FAQ
Kimi K3 全面开放权重是 2026 年开源(准确说开放权重)赛道最重要的事件之一:2.8T 规模、1M 上下文、完整 Infra 栈与 Artificial Analysis 全球第三的智能指数,证明中国实验室在工程创新上可与闭源前沿同台。但 open weight 不等于 open source,许可证与蒸馏争议要求企业用户保持清醒。
团队用 K3 驱动 Agent 对大型代码库长时调用时,仍需要稳定、可审计的本地开发与 CI 平面。共享分钟池、桌下 Mac 或超卖 VPS 上的宽带抖动、邻居 CPU 争抢与长连接中断,会迅速吃掉 Token 降价带来的收益。对更稳定的生产 Agent 主机与构建环境,NUKCLOUD 多区域裸金属 Mac / 云端 Mac 节点提供独占 Apple Silicon 算力与清晰租户边界,可在 定价页 对照规格并经 下单页 试跑。
数据截至 2026-07-28。来源:Moonshot AI 官方博客、Hugging Face、Vals AI SWE-bench、Artificial Analysis Intelligence Index、VentureBeat、Scientific American。发布前请以官方最新数据为准。