Claude Opus 5 价格减半逼近旗舰实力,Kimi K3 却陷「自称 Claude」蒸馏门

本周 AI 圈两件大事表面无关,实则都指向同一主题——性价比模型能力的真实来源:Anthropic 发布日常主力 Claude Opus 5;月之暗面 Kimi K3 则被白宫公开指控「蒸馏」Anthropic 技术,更有研究者发现它会自称是 Claude

一句话结论:2026 年 7 月 24 日 Anthropic 发布 Claude Opus 5——定价与 Opus 4.8 相同($5/$25 每百万 token),CursorBench 3.2 峰值仅比 Fable 5 低 0.5%,成本却减半;同期 Kimi K3 遭白宫指控「工业级蒸馏」,而 Ryan Greenblatt 的统计发现 K3 会吐出 claude-opus-4-5-20250929 等内部部署 ID。本文从Opus 5 基准与定价、K3 争议时间线、技术证据、选型矩阵四个维度解读,并附六步 Runbook 与 FAQ。

00Claude Opus 5 发布:不是旗舰,但可能是最值得用的 Claude

2026 年 7 月 24 日(美国太平洋时间),Anthropic 正式发布 Claude Opus 5,并同步将其设为 Claude Max 默认模型,Claude Pro 用户也可使用这一目前公开可用的最强版本。模型 ID 为 claude-opus-5,可通过 Claude API、AWS Bedrock、Google Vertex AI 与 Microsoft Foundry 访问。

  • 定价不变:输入 $5 / 百万 tokens,输出 $25 / 百万 tokens,与 Opus 4.8 完全相同;Fast 模式速度约 2.5 倍、价格 2 倍。
  • 上下文:100 万 tokens(默认且唯一档位),最大输出 128K tokens;Thinking 默认开启,Effort 参数控制思考量。
  • 数据留存:与历代 Opus 一致,默认访问不强制 30 天数据留存;Fable 5 / Mythos 5 则需用户接受留存政策。
基准测试Opus 5 表现对比说明
Frontier-Bench v0.1超越所有模型是 Opus 4.8 的两倍以上,单任务成本更低
CursorBench 3.2(max effort)与 Fable 5 峰值差 0.5%成本仅为 Fable 5 的一半
ARC-AGI 3次优模型的 3 倍新颖问题解决能力跃升
OSWorld 2.0任意成本下最优用 Fable 5 约 1/3 成本超过其最佳成绩
Zapier AutomationBench100% 通过率此前模型均未通过端到端账户健康工作流

Box 企业客户实测:数据分析工作流提升 11%,尽职调查提升 17%,整体准确率提升 8%。生命科学方面,从光谱推断分子结构比 Opus 4.8 高 10.2 个百分点,蛋白质序列变异功能预测高 7.7 个百分点

安全定位:Opus 5 是 Anthropic 迄今最对齐的模型(欺骗行为最低),但故意未刷新网络安全/生物安全前沿——该位置仍由受限发行的 Mythos 5 占据。网络安全分类器比 Fable 5 宽松约 85%,可用于源码级漏洞发现,仍屏蔽二进制漏洞扫描与 exploit 生成。

01Claude Opus 5 和 Fable 5 哪个好?选型对比

若你此前觉得 Fable 5 效果好但太贵,Opus 5 提供了「损失极小、成本减半」的替代方案。下列矩阵帮助快速决策:

维度Claude Opus 5Claude Fable 5
输入价(/M tokens)$5~$10
输出价(/M tokens)$25~$50
CursorBench 3.2 峰值与 Fable 5 差 0.5%最高
Claude Max 默认是(2026-07-24 起)
数据留存要求默认无强制留存需接受 30 天留存
双用途风险能力刻意受限更强(Mythos 5 更强)

Cursor 团队评价:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost.」Zapier 则称 Opus 5 在 AutomationBench 登顶且未消耗更多 token。若需多模型路由,可对照本站 OpenRouter 接入教程 做 Fallback 配置。

02Kimi K3「蒸馏门」:白宫下场,专家质疑时间线

如果说 Opus 5 是「正常发新品」,Kimi K3 的剧情则复杂得多。月之暗面于 2026 年 7 月 16 日发布 Kimi K3:总参数 2.8 万亿,896 专家 MoE 每次激活 16 个(约 500 亿激活参数),100 万 token 上下文与原生视觉理解,GPQA-Diamond 93.5%、BrowseComp 91.2%。完整权重承诺 7 月 27 日放出——争议爆发时外部尚无法独立验证。

日期事件
2026-02Anthropic 首次指控月之暗面/DeepSeek/MiniMax「产业级蒸馏攻击」,称检测到 340 万+ 异常 API 交互
2026-07-01Claude Fable 5 面向公众正式可用
2026-07-16Kimi K3 API/产品正式发布
2026-07-22/23白宫 OSTP 主任 Michael Kratsios 公开指控「大规模隐蔽工业级蒸馏」+ 涉嫌违规使用 Nvidia GB300 芯片
2026-07-23TechCrunch 刊发专家质疑蒸馏说的报道
2026-07-24Ryan Greenblatt 发布「K3 自称 Claude」统计证据
2026-07-27(计划)Kimi K3 完整权重开源

Kratsios 原话:「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology… is unacceptable.」财政部长 Scott Bessent 附和称在多个中国模型上发现美国大模型「水印」,但未说明具体指什么。

  • 时间线反驳:Fable 5 自 7 月 1 日才公开可用,到 K3 发布仅 两周。Snorkel AI 联合创始人 Braden Hancock 直言:「You can't distill that much data, train a model, and release it in two weeks.」
  • 边际收益递减:Allen AI 研究员 Nathan Lambert 认为,随着中国模型逼近前沿,简单蒸馏收益变小,真正拉开差距的是强化学习训练。
  • 行业「双标」:Elon Musk 曾在庭审中承认 xAI 训练 Grok 时蒸馏过 OpenAI 模型,并称这在行业内很常见——争议核心在于「正常借鉴」与「隐蔽窃取」的边界。

03最硬核证据:Kimi K3 会「自称是 Claude」

Redwood Research 首席科学家 Ryan Greenblatt 在 7 月 24 日前后发布统计分析(GitHub: rgreenblatt/which_claude_is_k3),对比多个模型被问「你是谁」时的身份自认行为。结果惊人:

  • Kimi K3 异常高频自称是 Claude,甚至会吐出 Claude 官方内部部署 ID,如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929
  • 真正的 Claude 模型自己不会这样报:Sonnet 4.5 只会说「我是 Claude Sonnet 4.5」,Opus 4.5 甚至不报或报错版本号。
  • 逐代追新规律:K2 信号指向 Claude Sonnet 4(2025 年中),K3 指向 Opus 4.5(2025 年末),而非当前 Fable/Mythos 系列。

Greenblatt 解读:模型说出「教师模型」部署元数据比教师自己还准,很难用「模仿对话风格」解释,更可能指向训练数据混入了带部署元数据标注的 Claude 数据(API 日志或打标合成数据)。这与本站此前对 Claude Code 指纹与追踪 的讨论形成呼应——模型身份泄露是检测数据污染的重要信号。

重要澄清:Greenblatt 强调这些发现不能直接证明蒸馏发生——身份混淆也可能来自训练数据污染、系统提示词泄露或公开数据集合成样本。但结合 Anthropic 2 月指控与统计规律性,这是迄今比「白宫喊话」更扎实的技术支撑。

痛点开发者选型时的隐性成本与合规风险

  • API 账单 vs 算力账单:Opus 5 半价逼近旗舰,但若 Agent 跑在共享 VPS 或桌下 Mac 上,队列抖动与长连接中断会迅速吃掉 token 降价收益。
  • 合规与供应链:Fable 5 / Mythos 5 的 30 天数据留存政策对金融、医疗场景是硬门槛;K3 的蒸馏指控则带来出口管制与政策不确定性。
  • 开源验证窗口:K3 完整权重 7 月 27 日前,所有架构与跑分仅为「官方自评 + 外部猜测」,生产接入存在信息不对称。
  • 模型路由复杂度:多模型 Fallback(Opus 5 + K3 + 本地推理)需要稳定 CI 与 Agent 宿主,而非仅换 API Key。

04六步 Runbook:本周模型更新后的生产接入

  1. 01
    审计现有 Claude 调用:检查是否仍指向 Opus 4.8 或 Fable 5;Claude Max 用户确认控制台已切换至 Opus 5 默认。
  2. 02
    跑 CursorBench / 内部基准冒烟:在 high / max effort 档位对比 Opus 5 与 Fable 5 在你真实代码库上的通过率与 token 消耗。
  3. 03
    评估数据留存条款:合规敏感场景优先 Opus 5(无强制留存);若需 Fable 5 峰值能力,单独评估 30 天留存政策影响。
  4. 04
    暂缓 K3 生产接入:等待 7 月 27 日权重放出后,独立复现 GPQA-Diamond / SWE Marathon 等基准,并运行 Greenblatt 式身份探针测试。
  5. 05
    配置多模型路由:经 OpenRouter 或 LiteLLM 设置 Opus 5 主路由 + 开源 Fallback,并记录每次调用的模型 ID 与成本。
  6. 06
    部署稳定 Agent 宿主:长时 Agent 会话需要独占算力与稳定 SSH。对照 定价页 评估 NUKCLOUD 独占 Mac 节点作为 CI 与 Agent 构建平面,避免共享池尾延迟吞噬 API 成本优势。

05两件事放在一起看:性价比才是主战场

Opus 5 用「半价逼近旗舰」回应市场对性价比的诉求;Kimi K3 用「开源 + 低价 + 少拒答」冲击市场;围绕 K3 的争议,本质上是各家在性价比战争里对「你的低价是靠技术优化还是白嫖别人模型」的公开摊牌。

对普通开发者:先看场景,再看立场。合规、数据留存、供应链敏感 → Opus 5 性价比极高;极限成本与开源可控 → 等 7 月 27 日 K3 权重实测后再决策。Reddit r/LocalLLaMA 上三方声音并存:欢呼开源闭源差距缩短到「天」而非「月」;调侃 2.8T 参数本地跑不动;务实派认为 K3 真正卖点是低价 + 无审查,而非「打败 Fable 5」。

团队用 Opus 5 或 K3 驱动长时 Agent 对大型代码库调用时,仍需要稳定、可审计的本地开发与 CI 平面。共享分钟池、桌下 Mac 或超卖 VPS 上的宽带抖动、邻居 CPU 争抢与长连接中断,会迅速吃掉 Token 降价带来的收益。对更稳定的生产 Agent 主机,NUKCLOUD 多区域裸金属 Mac / 云端 Mac 节点提供独占 Apple Silicon 算力与清晰租户边界,可在 定价页 对照规格并经 下单页 试跑。

06总结与 FAQ

Claude Opus 5 比 Claude Fable 5 便宜多少?
Opus 5 输入 $5/M、输出 $25/M,约为 Fable 5($10/$50 量级)的一半;CursorBench 3.2 峰值成绩相差不到 1%。
Claude Opus 5 现在是 Claude Max 的默认模型吗?
是的,2026 年 7 月 24 日发布当天起 Opus 5 成为 Claude Max 默认模型,也是 Claude Pro 用户可用的最强版本。
Kimi K3 真的蒸馏了 Claude 吗?
截至本文发布,这仍是有争议、未被最终证实的指控。白宫缺乏公开证据,专家从时间线角度质疑两周内完成深度蒸馏;Ryan Greenblatt 发现的「K3 自称是 Claude 并吐出内部版本号」是目前最具技术含量的间接证据。
Kimi K3 的完整权重什么时候能下载?
官方承诺 2026 年 7 月 27 日,本文发布时外部研究者尚无法完全独立验证架构与跑分。
为什么 Kimi K3 会自称是 Claude?
Greenblatt 统计分析显示 K3 会吐出 claude-opus-4-5-20250929 等内部部署 ID,比真正的 Claude 模型自己报得还准,可能指向训练数据混入了带部署元数据标注的 Claude API 日志或合成数据。
Agent CI 应跑在什么基础设施上?
长时 Agent 需要稳定 SSH、可预测磁盘 IO 与无邻居争抢算力。NUKCLOUD 独占 Mac 节点适合作为 Agent 宿主与 CI 构建平面。

数据截至 2026-07-25。来源:Anthropic 官方发布、Moonshot/Kimi 技术博客、TechCrunch、Ryan Greenblatt GitHub、CNBC、The Verge。