結論を先に: Grok 4.6 はまだ存在しない製品に近い状態です。目標は8月7日前後、規模は約1.5兆パラメータ、後学習で SFT と RL を厚くする——というのがマスク発の唯一の公開仕様です。4.5 の API 統合を終えたばかりのチームでも、K3 2.8T オープンウェイト との比較や8月の Fable 5.1 噂と並べて計画を立てる必要があります。以下にタイムライン、仕様表、痛点、競合マトリクス、6ステップ Runbook、FAQ をまとめます。
007月の加速:4.5から4.6へわずか20日
- 7月8日: xAI が Grok 4.5 を出荷。API は入力 $2/M・出力 $6/M、コンテキスト 50万 token、Cursor 共同学習。Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%。
- 7月16〜26日: Moonshot AI の Kimi K3 が API から 2.8T フルオープンウェイトへ。詳細は K3 全面公開記事。
- 7月中: xAI がユーザーに対し Grok 経由の CSAM 生成を巡る訴訟を提起——安全策の限界を示す事例として、エンタープライズのベンダーリスク表に追記が必要です。
- 7月28日: マスクが @rauchg に返信。4.6 は約 8月7日(1.5T、SFT/RL)、4.7 は 8月下旬〜9月初旬(2.1T、遅いが高品質)。同日、1100名超が 「Pacing the Frontier」 に署名し前沿競争の減速を訴えましたが、xAI は署名者リストにありません。
- 8月(未確認): Anthropic の Claude Fable 5.1 が同時期に出るという業界噂——公式発表はまだありません。
- 7月30日(執筆時点): 4.6 の技術ブログ・料金・ベンチはゼロ。仕様はツイート依存のままです。
01公式データとマスク発予告の切り分け
| 項目 | Grok 4.5(確認済み) | Grok 4.6(予告・未検証) | Grok 4.7(予告・未検証) |
|---|---|---|---|
| リリース日 | 2026-07-08 | 約 2026-08-07 | 8月下旬 – 9月初旬 |
| パラメータ | 非公開 MoE | 約 1.5T | 約 2.1T |
| 後学習の焦点 | Cursor 共同、Agent 最適化 | SFT + RL 大幅強化 | より大規模、低速 |
| コンテキスト | 500K | 未公表 | 未公表 |
| API 料金 | $2 / $6 per M | 未公表 | 未公表 |
| 独立ベンチ | 15項目公開 | — | — |
4.5 発売時はモデルカードと15ベンチが同時公開されました。4.6 は第三者評価が一切ない段階です。マスクが「プリトレーニング拡大より後学習(SFT・RL)」と強調するなら、コーディング Agent のタスク完了率が最初の勝負所になるはずですが、それも推測に留まります。
痛点8月のモデル計画が苦しい理由
- 調達カレンダーがツイート依存: xAI のプロダクトページも changelog もなく、8月スプリントを 4.6 前提で組むのは高リスクです。
- 旗艦の賞味期限: 4.5 のプロンプト調整が終わる前に次世代が来る。ベンチで優位が証明される前に移行コストだけが発生します。
- パラメータ比較の罠: 1.5T と K3 の 2.8T は MoE の活性パラメータ・後学習品質・コンテキスト長なしでは比較できません。
- デュアル SKU の混乱: 4.6(速い)と 4.7(強いが遅い)が同時に予告され、どちらを待つか・API model ID は何か・価格差はいくらかが不明です。
- クローズド vs オープンウェイト: xAI は閉源 API のみ。Kimi K3 は自ホスト可能。データレジデンシーとベンダーロックインを並行評価してください。
- コンプライアンスの重し: 7月の CSAM 訴訟と児童安全評価の議論は、リリース加速と同時に進むため、法務レビューが技術サイクルより長くなる可能性があります。
- 業界の二極化: 同日の 「Pacing the Frontier」 は減速を、xAI は20日周期で加速を——予算と検証人員に四半期リズムがないと破綻しやすいです。
02競合マトリクス:4.6が超えるべきライン
| モデル | パラメータ | コンテキスト | SWE-Bench Pro | Terminal-Bench 2.1 | 提供形態 |
|---|---|---|---|---|---|
| Grok 4.5 | 非公開 MoE | 500K | 64.7% | 83.3% | 閉源 API / Cursor |
| Kimi K3 | 2.8T オープンウェイト | 1M | 93.4%(Vals Verified) | — | API + 自ホスト |
| Claude Fable 5.1 | 非公開 | 200K+ | 〜80%級(Fable 5 約80.4%) | 84.3%(Fable 5) | 閉源 API(8月噂) |
| Grok 4.6(予告) | 〜1.5T(未検証) | 未公表 | — | — | 閉源 API 想定 |
料金と1タスクあたりコスト(4.5は確定)
| モデル | 入出力(per M) | コーディング Agent 1タスク(参考) |
|---|---|---|
| Grok 4.5 | $2 / $6 | 約 $2.49 |
| Kimi K3 | $0.30(キャッシュ)– $3 / $15 | 約 $0.95 |
| Claude Fable 5 | 高価格帯 | 約 $11.80 |
| Grok 4.6 | 未公表 | — |
03Grok 4.7:二波目の大型版
マスクは 4.7 を 4.6 の上に積む「能力版」と位置づけています。約 2.1T、レイテンシは犠牲に品質とトークン効率を取る——リリースは 8月下旬から9月初旬。8月だけで二 SKU が出る可能性があり、Fast / Max のような二層戦略に見えますが、命名も API ID も未発表です。
実務では 4.6=低遅延の高頻度 Agent(CI 修復、ターミナル作業)、4.7=品質重視の長い推論(設計、大規模リファクタ)と割り切るのが現実的です。公式ベンチが出るまでは、Kimi K3 や GPT-6 ロビー動向 の閉源旗艦を上回るとは限りません。
04六ステップ Runbook:4.6 リリース前の準備
-
01
4.5 ベースラインを固定:Cursor / API での SWE 系スモーク、1タスクあたりの token 消費と P95 レイテンシを記録し、4.6 投入後の A/B に使います。4.5 ベンチ解説を参照してください。
-
02
公式チャネルにアラート:xAI changelog、
api.x.aiのモデル一覧、Grok Build 告知を監視。8月7日前後は SNS 転載ではなく一次情報で確認します。 -
03
三ルート構成の草案:4.6(速)/ 4.7(強)/ Kimi K3(長コンテキスト OSS)。独立ベンチが出るまで 4.5 本番は止めないでください。
-
04
予算のバッファ:4.5 の $2/$6 で8月用量を見積もり、値上げや上位 SKU 分離に 15〜25% の余裕を確保。NUKCLOUD 料金と Agent ホスト・CI 固定費を合算します。
-
05
ベンダー自報ではなく第三者:4.6 後は Vals AI、Artificial Analysis 等の SWE-Bench / Terminal-Bench 再現を待ち、コアパイプラインの移行を判断します。
-
06
組織のペースを合わせる:「Pacing the Frontier」の文脈を読み、20日周期がチームの消化能力を超えるなら四半期レビューに切り替え、「最新 Grok 必須」方針を凍結します。
05まとめと FAQ
Grok 4.6 は「7月の最速イテレーション」物語の続編です。4.5 から20日で 1.5T + SFT/RL と 2.1T の 4.7 が予告され、8月は Fable 5.1 噂とも重なります。エンジニアリングチームにとって重要なのは8月7日に飛びつくことではなく、再現可能なベースラインと独立ベンチ、そして閉源 Grok と オープンウェイト K3 のルーティング柔軟性です。
高頻度 Grok Agent を共有 VPS やオーバーセルクラウドで回すと、CPU 奪い合い・SSH 切断・ビルドキューのジッターがモデル単価のメリットをすぐ消します。安定したターミナル Bench と CI 平面が必要なチームには、NUKCLOUD のマルチリージョン裸金属 Mac / クラウド Macが専有 Apple Silicon と明確なテナント境界を提供します。料金ページで仕様を確認し、注文ページから Agent ホスト環境を試せます。
データは2026-07-30時点。出典:マスク X 投稿、xAI Grok 4.5 公式、当サイト Grok 4.5 レビュー、Kimi K3 記事。4.6 / 4.7 仕様は予告段階です。