結論を先に:2026年7月24日、Anthropic は Claude Opus 5 を公開しました。料金は Opus 4.8 と同じ $5/$25(100万トークンあたり)のまま、CursorBench 3.2 ピークは Fable 5 との差が 0.5% にとどまり、コストは半分です。同時期、Kimi K3 はホワイトハウスから「産業規模の蒸留」を非難され、Ryan Greenblatt の統計では K3 が claude-opus-4-5-20250929 などの内部デプロイ ID を漏らします。本記事では Opus 5 のベンチマークと料金、K3 論争のタイムライン、技術的証拠、選定マトリクス の4軸で整理し、6ステップ Runbook と FAQ を付けます。
00Claude Opus 5 公開:旗艦ではないが、最も使い勝手の良い Claude かもしれない
2026年7月24日(米国太平洋時間)、Anthropic は Claude Opus 5 を正式公開し、同日から Claude Max のデフォルトモデル に設定しました。Claude Pro ユーザー向けの公開最強版でもあります。モデル ID は claude-opus-5 で、Claude API・AWS Bedrock・Google Vertex AI・Microsoft Foundry から利用できます。
- 料金据え置き:入力 $5 / 100万トークン、出力 $25 / 100万トークン。Opus 4.8 と同一。Fast モードは約2.5倍速・2倍料金。
- コンテキスト:100万トークン(唯一のデフォルト)。最大出力 128K。Thinking はデフォルト有効、Effort パラメータで思考量を制御。
- データ保持:従来の Opus 系列同様、デフォルトでは30日間の強制データ保持なし。Fable 5 / Mythos 5 は保持ポリシーへの同意が必要。
| ベンチマーク | Opus 5 の結果 | 比較メモ |
|---|---|---|
| Frontier-Bench v0.1 | 全モデル超越 | Opus 4.8 の2倍以上、タスク単価も低い |
| CursorBench 3.2(max effort) | Fable 5 ピークとの差 0.5% | コストは Fable 5 の半分 |
| ARC-AGI 3 | 次点モデルの 3倍 | 新規問題解決能力が大幅向上 |
| OSWorld 2.0 | 任意コスト帯で最良 | Fable 5 最高スコアを約1/3コストで上回る |
| Zapier AutomationBench | 100% 合格 | 従来モデルは E2E アカウント健全性 WF を未通過 |
Box の企業顧客実測では、データ分析 WF が 11%、デューデリジェンスが 17%、全体精度が 8% 向上。生命科学では、スペクトルから分子構造を推定する精度が Opus 4.8 比 10.2ポイント、タンパク質配列変異の機能予測が 7.7ポイント 向上しています。
01Claude Opus 5 と Fable 5、どちらを選ぶべきか
Fable 5 の品質は認めつつもコストがネックだったチームにとって、Opus 5 は「わずかな性能差で半額」という選択肢を提供します。次のマトリクスで素早く判断できます。
| 観点 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 入力単価(/M tokens) | $5 | ~$10 |
| 出力単価(/M tokens) | $25 | ~$50 |
| CursorBench 3.2 ピーク | Fable 5 との差 0.5% | 最高 |
| Claude Max デフォルト | はい(2026-07-24〜) | いいえ |
| データ保持要件 | デフォルトで強制保持なし | 30日保持への同意が必要 |
| デュアルユース能力 | 意図的に制限 | より強い(Mythos 5 がさらに上) |
Cursor チームの評価は「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost.」Zapier は AutomationBench で Opus 5 がトークン消費を増やさず首位に立ったと述べています。マルチモデルルーティングを組む場合は、当サイトの OpenRouter 接続ガイド で Fallback 設定を参照してください。
02Kimi K3「蒸留門」:ホワイトハウスが介入、専門家は時間線に疑問
Opus 5 が「通常の新製品発表」なら、Kimi K3 の展開ははるかに複雑です。Moonshot AI は2026年7月16日に Kimi K3 を公開。総パラメータ 2.8兆、896 エキスパート MoE で推論時 16 個活性化(約500億活性パラメータ)、100万トークンコンテキストとネイティブ視覚理解。GPQA-Diamond 93.5%、BrowseComp 91.2%。完全ウェイトは 7月27日公開予定——論争が起きた時点では外部の独立検証は不可能でした。
| 日付 | 出来事 |
|---|---|
| 2026-02 | Anthropic が Moonshot / DeepSeek / MiniMax に「産業規模の蒸留攻撃」を初告発。340万超の異常 API 相互作用を検出と主張 |
| 2026-07-01 | Claude Fable 5 が一般公開 |
| 2026-07-16 | Kimi K3 API / 製品正式リリース |
| 2026-07-22/23 | ホワイトハウス OSTP 長 Michael Kratsios が「大規模かつ隠蔽的な産業蒸留」+ Nvidia GB300 不正使用の疑いを公然非難 |
| 2026-07-23 | TechCrunch が専門家の蒸留説への疑問を報道 |
| 2026-07-24 | Ryan Greenblatt が「K3 が Claude 自称」統計証拠を公開 |
| 2026-07-27(予定) | Kimi K3 完全ウェイトのオープンソース公開 |
Kratsios の原話:「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology… is unacceptable.」財務長官 Scott Bessent も複数の中国モデルで米国大規模モデルの「ウォーターマーク」を発見したと述べましたが、具体的内容は示していません。
- 時間線への反論:Fable 5 は7月1日から一般利用可能。K3 公開まで2週間しかありません。Snorkel AI 共同創業者 Braden Hancock は「You can't distill that much data, train a model, and release it in two weeks.」と明言しています。
- 限界効用逓減:Allen AI 研究員 Nathan Lambert は、中国モデルがフロンティアに接近するほど単純蒸留の効果は小さく、差を広げるのは強化学習トレーニングだと指摘しています。
- 業界の「二重基準」:Elon Musk は審理で xAI が Grok 訓練時に OpenAI モデルを蒸留したことを認め、業界では一般的だと述べました——争点は「正常な参考」と「隠蔽的窃取」の境界です。
03最も硬い証拠:Kimi K3 が「Claude 自称」する
Redwood Research 首席科学者 Ryan Greenblatt は7月24日前後、統計分析(GitHub: rgreenblatt/which_claude_is_k3)を公開しました。「あなたは誰ですか」と尋ねた際の自己申告を複数モデルで比較した結果は驚くべきものでした。
- Kimi K3 は異常に高頻度で Claude 自称し、
claude-opus-4-5-20250929、claude-sonnet-4-5-20250929など Claude 公式の内部デプロイ ID まで漏らします。 - 本物の Claude はそう報告しない:Sonnet 4.5 は「Claude Sonnet 4.5」とだけ答え、Opus 4.5 はバージョンを報告しないかエラーになります。
- 世代追従の規則性:K2 のシグナルは Claude Sonnet 4(2025年中期)、K3 は Opus 4.5(2025年末)を指し、現行 Fable / Mythos 系列ではありません。
Greenblatt の解釈では、モデルが「教師モデル」のデプロイメタデータを教師自身より正確に語るのは「会話スタイルの模倣」では説明しにくく、デプロイメタデータ付き Claude データ(API ログやラベル付き合成データ)の学習混入を示唆します。これは当サイトの Claude Code 指紋と追跡 の議論とも呼応します——モデルのアイデンティティ漏洩はデータ汚染検出の重要シグナルです。
課題開発者が選定時に直面する隠れコストとコンプライアンスリスク
- API 請求 vs 算力請求:Opus 5 は半額で旗艦に接近しますが、Agent を共有 VPS やデスク下 Mac で動かすと、キュー遅延と長時間接続断でトークン値下げの恩恵がすぐ消えます。
- コンプライアンスとサプライチェーン:Fable 5 / Mythos 5 の30日データ保持は金融・医療でハードル。K3 の蒸留疑惑は輸出規制と政策不確実性をもたらします。
- オープンソース検証ウィンドウ:7月27日以前、K3 のアーキテクチャとスコアは「公式自己評価 + 外部推測」に留まり、本番接続には情報非対称が残ります。
- モデルルーティングの複雑化:Opus 5 + K3 + ローカル推論のマルチモデル Fallback には、API Key 差し替え以上に安定した CI と Agent ホストが必要です。
046ステップ Runbook:今週のモデル更新後の本番接続
-
01
既存 Claude 呼び出しを監査:Opus 4.8 や Fable 5 を指していないか確認。Claude Max ユーザーはコンソールが Opus 5 デフォルトに切り替わっているか確認してください。
-
02
CursorBench / 社内ベンチマークでスモーク:high / max effort で Opus 5 と Fable 5 を実コードベース上で比較し、合格率とトークン消費を記録します。
-
03
データ保持条項を評価:コンプライアンス重視なら Opus 5(強制保持なし)を優先。Fable 5 のピーク能力が必要なら30日保持ポリシーの影響を個別評価します。
-
04
K3 の本番接続は保留:7月27日のウェイト公開後、GPQA-Diamond / SWE Marathon 等を独立再現し、Greenblatt 式のアイデンティティプローブも実行してください。
-
05
マルチモデルルーティングを構成:OpenRouter または LiteLLM で Opus 5 を主ルート + OSS Fallback に設定し、各呼び出しのモデル ID とコストを記録します。
-
06
安定した Agent ホストをデプロイ:長時間 Agent セッションには専有算力と安定 SSH が必要です。料金ページで NUKCLOUD 専有 Mac ノードを CI と Agent 構築プレーンとして評価し、共有プールの尾遅延が API コスト優位を食い潰すのを防ぎます。
05二つの出来事を並べて見る:主戦場はコスパ
Opus 5 は「半額で旗艦に接近」で市場のコスパ要求に応え、Kimi K3 は「オープンソース + 低価格 + 少ない拒否応答」で市場を揺さぶります。K3 を巡る論争の本質は、各社がコスパ戦争の中で「低価格は技術最適化か、他社モデルの無断利用か」を公然と問い直している点にあります。
一般の開発者にとっては先にシナリオ、次に立場です。コンプライアンス・データ保持・サプライチェーン重視なら Opus 5 のコスパは極めて高い。極限コストと OSS 制御なら7月27日の K3 ウェイト実測後に判断を。Reddit r/LocalLLaMA では、OSS とクローズドの差が「月」から「日」に縮まったとの歓声、2.8T パラメータはローカルでは動かないとの冗談、K3 の真の売りは低価格 + 審査なしであって「Fable 5 打倒」ではないという実務派の声が共存しています。
Opus 5 や K3 で大規模コードベースに長時間 Agent を走らせるチームには、安定・監査可能なローカル開発と CI プレーンが依然として必要です。共有分課プール、デスク下 Mac、オーバーセル VPS では帯域ジッター、隣接テナントの CPU 争奪、長時間接続断がトークン値下げの利益をすぐに消します。より安定した本番 Agent ホストには、NUKCLOUD 多リージョン裸金属 Mac / クラウド Mac ノードが専有 Apple Silicon 算力と明確なテナント境界を提供します。料金ページで仕様を確認し、注文ページから試走できます。
06まとめと FAQ
claude-opus-4-5-20250929 などの内部デプロイ ID を漏らし、本物の Claude モデル自身より正確に報告します。デプロイメタデータ付き Claude API ログや合成データが学習データに混入した可能性が示唆されます。データは2026-07-25時点。出典:Anthropic 公式発表、Moonshot/Kimi 技術ブログ、TechCrunch、Ryan Greenblatt GitHub、CNBC、The Verge。