先講結論: Grok 4.6 迄今僅有馬斯克推文級預告——目標 8 月 7 日、約 1.5 兆參數、後訓練強化 SFT 與 RL,尚無 xAI 技術報告或 API 上架。若你剛完成 Grok 4.5 接入,或正與 Kimi K3 開放權重、8 月傳聞中的 Claude Fable 5.1 比較,下文提供可操作的時間線、對照表與遷移前檢查;凡未經官方證實的數字均標為「待核實」。
00七月下旬時間軸:4.5 剛熱,4.6 已來
| 日期 | 事件 |
|---|---|
| 7 月 8 日 | xAI 發布 Grok 4.5:API $2/$6 per M、50 萬 token 上下文、與 Cursor 聯合訓練;Terminal-Bench 2.1 83.3%,SWE-Bench Pro 64.7%。 |
| 7 月 16–26 日 | 月之暗面 Kimi K3 從 API 到 2.8T 全面開放權重,改寫開源賽道。詳見 K3 開放權重解讀。 |
| 7 月(訴訟) | xAI 對一名用戶提起訴訟,指控其利用 Grok 生成 CSAM——首次公開承認護欄可被繞過,企業供應商風險審查需納入合規維度。 |
| 7 月 28 日 | 馬斯克回覆 @rauchg:4.6 約 8 月 7 日(1.5T、SFT/RL);4.7 約 8 月下旬–9 月初(2.1T、更強更慢)。同日 《Pacing the Frontier》 公開信發布,OpenAI、Anthropic 等企業背書,xAI 缺席。 |
| 8 月(傳聞) | 業界傳聞 Anthropic 可能推出 Claude Fable 5.1,與 Grok 4.6 窗口重疊——未經官方證實。 |
| 7 月 30 日 | 本文撰寫日:xAI 未公布 4.6 定價、benchmark 或模型卡;規格來源仍為單一推文。 |
01規格表:已證實 vs 預告
| 項目 | Grok 4.5(已證實) | Grok 4.6(預告) | Grok 4.7(預告) |
|---|---|---|---|
| 發布日 | 2026-07-08 | 約 2026-08-07 | 8 月下旬 – 9 月初 |
| 參數量 | 未公開 MoE | 約 1.5T | 約 2.1T |
| 後訓練 | Cursor 聯合、Agent 優化 | SFT + RL 大幅升級 | 更大規模、速度更慢 |
| 上下文 | 500K | 未公布 | 未公布 |
| API 定價 | $2 / $6 per M | 未公布 | 未公布 |
| 公開 benchmark | 15 項已公布 | — | — |
與 4.5 發布時附帶完整模型卡不同,4.6 目前零獨立評測。馬斯克稱增益主要來自後訓練管線——若屬實,程式 Agent 與工作流完成率或為首要受益場景,但需等 Vals AI、Artificial Analysis 等第三方復測。
痛點八月選型為何特別難
- 單一資訊源: 採購日曆綁在一則推文上,沒有 beta、沒有 SLA,滑期時無官方補償機制。
- 旗艦保鮮期極短: 4.5 剛完成 Prompt 調優,4.6 可能已讓現有流水線「過期」——遷移成本尚未攤銷。
- 參數 headline 陷阱: 1.5T 與 K3 的 2.8T 不可直接比較;MoE 激活參數、後訓練品質與上下文長度才決定實用價值。
- 雙 SKU 決策癱瘓: 4.6(快)與 4.7(強但慢)同線預告,團隊不知該等哪一版,API model ID 與價差皆未知。
- 閉源 vs 開放權重: xAI 全線閉源;Kimi K3 已可自部署。資料駐留與供應商鎖定需並行評估。
- 合規陰影: 7 月 CSAM 訴訟與兒童安全評級爭議,與「20 天一代」的發布節奏並存,法務審查週期可能長於技術迭代週期。
- 行業節奏撕裂: 同日《Pacing the Frontier》呼籲減速,xAI 卻加速——預算與驗證人力若無季度級節奏,易陷入「必跟最新 Grok」的惡性循環。
02競品矩陣:4.6 需超越的基準線
4.6 尚無跑分。下表以當前可引用數據對照 Grok 4.5、Kimi K3 與傳聞中的 Fable 5.1 級前沿。
| 模型 | 參數 | 上下文 | SWE-Bench Pro | Terminal-Bench 2.1 | 形態 |
|---|---|---|---|---|---|
| Grok 4.5 | 未公開 MoE | 500K | 64.7% | 83.3% | 閉源 API / Cursor |
| Kimi K3 | 2.8T 開放權重 | 1M | 93.4%(Vals Verified) | — | API + 自部署 |
| Claude Fable 5.1 | 未公開 | 200K+ | ~80% 級(Fable 5 約 80.4%) | 84.3%(Fable 5) | 閉源 API(傳聞 8 月) |
| Grok 4.6 | ~1.5T(待核實) | 未公布 | — | — | 預計閉源 API |
定價參考(4.5 已證實)
| 模型 | 輸入 / 輸出(per M) | 程式 Agent 單次成本(參考) |
|---|---|---|
| Grok 4.5 | $2 / $6 | 約 $2.49 |
| Kimi K3 | $0.30(快取)– $3 / $15 | 約 $0.95 |
| Claude Fable 5 | 更高檔 | 約 $11.80 |
| Grok 4.6 | 未公布 | — |
034.7 雙軌:快取強、慢取大
馬斯克把 4.7 定位為 4.6 之後的「能力版」:約 2.1T、推理更慢但品質更高,窗口落在 8 月下旬至 9 月初。這暗示 xAI 可能在八月內連續投放兩個 SKU——類似 Fast / Max 分層,但命名與 API ID 均未公布。
實務上可預期:4.6 服務延遲敏感的高頻 Agent(CI 修 bug、終端任務),4.7 服務品質敏感的長推理(架構設計、複雜重構)。在官方 benchmark 出爐前,不宜假設 4.7 必然全面超越 Kimi K3 或 GPT-6 前哨動態 中的閉源旗艦。
04六步 Runbook:4.6 發布前準備
-
01
固化 4.5 基線:記錄 Cursor / API 任務的 SWE 類冒煙用例、單次 Token 與延遲 P95,作為 4.6 上線後 A/B 對照。參考 4.5 benchmark 拆解。
-
02
訂閱官方渠道:監控 xAI changelog、
api.x.ai模型列表與 Grok Build 公告;8 月 7 日前後設告警,勿僅依社群轉載。 -
03
預留三路由草案:4.6(快)/ 4.7(強)/ Kimi K3(長上下文開源);獨立 benchmark 公布前勿關閉 4.5 生產流量。
-
04
預算彈性區間:按 4.5 的 $2/$6 估算八月用量,為可能漲價或分檔計價預留 15–25% 緩衝;對照 NUKCLOUD 定價 核算 Agent 宿主與 CI 固定成本。
-
05
等第三方復測:4.6 發布後優先等 Vals AI、Artificial Analysis 等 SWE-Bench / Terminal-Bench 復測,再決定是否遷移核心流水線。
-
06
校準組織節奏:閱讀 《Pacing the Frontier》 背景;若 20 天一代超出團隊消化能力,改走季度級模型評審,凍結「必跟最新 Grok」策略。
05總結與 FAQ
Grok 4.6 是 2026 年七月「最快迭代」敘事的又一注腳:4.5 上線二十天後即預告 1.5T + SFT/RL 與 2.1T 的 4.7 雙軌。對工程團隊,關鍵不是搶跑 8 月 7 日,而是建立可復現基線、等待獨立 benchmark,並在閉源 Grok 與 開放權重 K3 之間保持路由彈性。
高頻 Grok Agent 跑在共享 VPS 或超賣雲主機上時,鄰居 CPU 爭搶、SSH 長連線中斷與構建佇列抖動會迅速吃掉模型降價收益。對需要穩定終端 Bench 與 CI 平面的團隊,NUKCLOUD 多區域裸金屬 Mac / 雲端 Mac 節點提供獨占 Apple Silicon 算力與清晰租戶邊界,可在 定價頁 對照規格並經 下單頁 試跑 Agent 宿主環境。
數據截至 2026-07-30。來源:馬斯克 X 推文、xAI Grok 4.5 官方材料、本站 Grok 4.5 評測、Kimi K3 報導。4.6 / 4.7 規格均為預告級,發布前請以官方最新數據為準。