一句话结论:2026 年 7 月 24 日 Anthropic 发布 Claude Opus 5——定价与 Opus 4.8 相同($5/$25 每百万 token),CursorBench 3.2 峰值仅比 Fable 5 低 0.5%,成本却减半;同期 Kimi K3 遭白宫指控「工业级蒸馏」,而 Ryan Greenblatt 的统计发现 K3 会吐出 claude-opus-4-5-20250929 等内部部署 ID。本文从Opus 5 基准与定价、K3 争议时间线、技术证据、选型矩阵四个维度解读,并附六步 Runbook 与 FAQ。
00Claude Opus 5 发布:不是旗舰,但可能是最值得用的 Claude
2026 年 7 月 24 日(美国太平洋时间),Anthropic 正式发布 Claude Opus 5,并同步将其设为 Claude Max 默认模型,Claude Pro 用户也可使用这一目前公开可用的最强版本。模型 ID 为 claude-opus-5,可通过 Claude API、AWS Bedrock、Google Vertex AI 与 Microsoft Foundry 访问。
- 定价不变:输入 $5 / 百万 tokens,输出 $25 / 百万 tokens,与 Opus 4.8 完全相同;Fast 模式速度约 2.5 倍、价格 2 倍。
- 上下文:100 万 tokens(默认且唯一档位),最大输出 128K tokens;Thinking 默认开启,Effort 参数控制思考量。
- 数据留存:与历代 Opus 一致,默认访问不强制 30 天数据留存;Fable 5 / Mythos 5 则需用户接受留存政策。
| 基准测试 | Opus 5 表现 | 对比说明 |
|---|---|---|
| Frontier-Bench v0.1 | 超越所有模型 | 是 Opus 4.8 的两倍以上,单任务成本更低 |
| CursorBench 3.2(max effort) | 与 Fable 5 峰值差 0.5% | 成本仅为 Fable 5 的一半 |
| ARC-AGI 3 | 次优模型的 3 倍 | 新颖问题解决能力跃升 |
| OSWorld 2.0 | 任意成本下最优 | 用 Fable 5 约 1/3 成本超过其最佳成绩 |
| Zapier AutomationBench | 100% 通过率 | 此前模型均未通过端到端账户健康工作流 |
Box 企业客户实测:数据分析工作流提升 11%,尽职调查提升 17%,整体准确率提升 8%。生命科学方面,从光谱推断分子结构比 Opus 4.8 高 10.2 个百分点,蛋白质序列变异功能预测高 7.7 个百分点。
01Claude Opus 5 和 Fable 5 哪个好?选型对比
若你此前觉得 Fable 5 效果好但太贵,Opus 5 提供了「损失极小、成本减半」的替代方案。下列矩阵帮助快速决策:
| 维度 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 输入价(/M tokens) | $5 | ~$10 |
| 输出价(/M tokens) | $25 | ~$50 |
| CursorBench 3.2 峰值 | 与 Fable 5 差 0.5% | 最高 |
| Claude Max 默认 | 是(2026-07-24 起) | 否 |
| 数据留存要求 | 默认无强制留存 | 需接受 30 天留存 |
| 双用途风险能力 | 刻意受限 | 更强(Mythos 5 更强) |
Cursor 团队评价:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost.」Zapier 则称 Opus 5 在 AutomationBench 登顶且未消耗更多 token。若需多模型路由,可对照本站 OpenRouter 接入教程 做 Fallback 配置。
02Kimi K3「蒸馏门」:白宫下场,专家质疑时间线
如果说 Opus 5 是「正常发新品」,Kimi K3 的剧情则复杂得多。月之暗面于 2026 年 7 月 16 日发布 Kimi K3:总参数 2.8 万亿,896 专家 MoE 每次激活 16 个(约 500 亿激活参数),100 万 token 上下文与原生视觉理解,GPQA-Diamond 93.5%、BrowseComp 91.2%。完整权重承诺 7 月 27 日放出——争议爆发时外部尚无法独立验证。
| 日期 | 事件 |
|---|---|
| 2026-02 | Anthropic 首次指控月之暗面/DeepSeek/MiniMax「产业级蒸馏攻击」,称检测到 340 万+ 异常 API 交互 |
| 2026-07-01 | Claude Fable 5 面向公众正式可用 |
| 2026-07-16 | Kimi K3 API/产品正式发布 |
| 2026-07-22/23 | 白宫 OSTP 主任 Michael Kratsios 公开指控「大规模隐蔽工业级蒸馏」+ 涉嫌违规使用 Nvidia GB300 芯片 |
| 2026-07-23 | TechCrunch 刊发专家质疑蒸馏说的报道 |
| 2026-07-24 | Ryan Greenblatt 发布「K3 自称 Claude」统计证据 |
| 2026-07-27(计划) | Kimi K3 完整权重开源 |
Kratsios 原话:「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology… is unacceptable.」财政部长 Scott Bessent 附和称在多个中国模型上发现美国大模型「水印」,但未说明具体指什么。
- 时间线反驳:Fable 5 自 7 月 1 日才公开可用,到 K3 发布仅 两周。Snorkel AI 联合创始人 Braden Hancock 直言:「You can't distill that much data, train a model, and release it in two weeks.」
- 边际收益递减:Allen AI 研究员 Nathan Lambert 认为,随着中国模型逼近前沿,简单蒸馏收益变小,真正拉开差距的是强化学习训练。
- 行业「双标」:Elon Musk 曾在庭审中承认 xAI 训练 Grok 时蒸馏过 OpenAI 模型,并称这在行业内很常见——争议核心在于「正常借鉴」与「隐蔽窃取」的边界。
03最硬核证据:Kimi K3 会「自称是 Claude」
Redwood Research 首席科学家 Ryan Greenblatt 在 7 月 24 日前后发布统计分析(GitHub: rgreenblatt/which_claude_is_k3),对比多个模型被问「你是谁」时的身份自认行为。结果惊人:
- Kimi K3 异常高频自称是 Claude,甚至会吐出 Claude 官方内部部署 ID,如
claude-opus-4-5-20250929、claude-sonnet-4-5-20250929。 - 真正的 Claude 模型自己不会这样报:Sonnet 4.5 只会说「我是 Claude Sonnet 4.5」,Opus 4.5 甚至不报或报错版本号。
- 逐代追新规律:K2 信号指向 Claude Sonnet 4(2025 年中),K3 指向 Opus 4.5(2025 年末),而非当前 Fable/Mythos 系列。
Greenblatt 解读:模型说出「教师模型」部署元数据比教师自己还准,很难用「模仿对话风格」解释,更可能指向训练数据混入了带部署元数据标注的 Claude 数据(API 日志或打标合成数据)。这与本站此前对 Claude Code 指纹与追踪 的讨论形成呼应——模型身份泄露是检测数据污染的重要信号。
痛点开发者选型时的隐性成本与合规风险
- API 账单 vs 算力账单:Opus 5 半价逼近旗舰,但若 Agent 跑在共享 VPS 或桌下 Mac 上,队列抖动与长连接中断会迅速吃掉 token 降价收益。
- 合规与供应链:Fable 5 / Mythos 5 的 30 天数据留存政策对金融、医疗场景是硬门槛;K3 的蒸馏指控则带来出口管制与政策不确定性。
- 开源验证窗口:K3 完整权重 7 月 27 日前,所有架构与跑分仅为「官方自评 + 外部猜测」,生产接入存在信息不对称。
- 模型路由复杂度:多模型 Fallback(Opus 5 + K3 + 本地推理)需要稳定 CI 与 Agent 宿主,而非仅换 API Key。
04六步 Runbook:本周模型更新后的生产接入
-
01
审计现有 Claude 调用:检查是否仍指向 Opus 4.8 或 Fable 5;Claude Max 用户确认控制台已切换至 Opus 5 默认。
-
02
跑 CursorBench / 内部基准冒烟:在 high / max effort 档位对比 Opus 5 与 Fable 5 在你真实代码库上的通过率与 token 消耗。
-
03
评估数据留存条款:合规敏感场景优先 Opus 5(无强制留存);若需 Fable 5 峰值能力,单独评估 30 天留存政策影响。
-
04
暂缓 K3 生产接入:等待 7 月 27 日权重放出后,独立复现 GPQA-Diamond / SWE Marathon 等基准,并运行 Greenblatt 式身份探针测试。
-
05
配置多模型路由:经 OpenRouter 或 LiteLLM 设置 Opus 5 主路由 + 开源 Fallback,并记录每次调用的模型 ID 与成本。
-
06
部署稳定 Agent 宿主:长时 Agent 会话需要独占算力与稳定 SSH。对照 定价页 评估 NUKCLOUD 独占 Mac 节点作为 CI 与 Agent 构建平面,避免共享池尾延迟吞噬 API 成本优势。
05两件事放在一起看:性价比才是主战场
Opus 5 用「半价逼近旗舰」回应市场对性价比的诉求;Kimi K3 用「开源 + 低价 + 少拒答」冲击市场;围绕 K3 的争议,本质上是各家在性价比战争里对「你的低价是靠技术优化还是白嫖别人模型」的公开摊牌。
对普通开发者:先看场景,再看立场。合规、数据留存、供应链敏感 → Opus 5 性价比极高;极限成本与开源可控 → 等 7 月 27 日 K3 权重实测后再决策。Reddit r/LocalLLaMA 上三方声音并存:欢呼开源闭源差距缩短到「天」而非「月」;调侃 2.8T 参数本地跑不动;务实派认为 K3 真正卖点是低价 + 无审查,而非「打败 Fable 5」。
团队用 Opus 5 或 K3 驱动长时 Agent 对大型代码库调用时,仍需要稳定、可审计的本地开发与 CI 平面。共享分钟池、桌下 Mac 或超卖 VPS 上的宽带抖动、邻居 CPU 争抢与长连接中断,会迅速吃掉 Token 降价带来的收益。对更稳定的生产 Agent 主机,NUKCLOUD 多区域裸金属 Mac / 云端 Mac 节点提供独占 Apple Silicon 算力与清晰租户边界,可在 定价页 对照规格并经 下单页 试跑。
06总结与 FAQ
claude-opus-4-5-20250929 等内部部署 ID,比真正的 Claude 模型自己报得还准,可能指向训练数据混入了带部署元数据标注的 Claude API 日志或合成数据。数据截至 2026-07-25。来源:Anthropic 官方发布、Moonshot/Kimi 技术博客、TechCrunch、Ryan Greenblatt GitHub、CNBC、The Verge。