一句话结论: Grok 4.6 目前仅有马斯克推文级预告——目标 8 月 7 日、参数约 1.5T、后训练侧重 SFT + RL,尚无 xAI 官方技术博客或 API 上架。若你刚在 Cursor 接入 Grok 4.5,或正对比 Kimi K3 开放权重 与闭源前沿,本文给出时间线、痛点、对比表、六步准备清单与五条 FAQ;所有未官方证实的数据均标注「待核实」。
00时间线:从 Grok 4.5 到马斯克「双版本」预告
- 7 月 8 日: xAI 正式发布 Grok 4.5。API 定价输入 $2/M、输出 $6/M;上下文 50 万 token;与 Cursor 联合训练;Terminal-Bench 2.1 83.3%,SWE-Bench Pro 64.7%。
- 7 月 16–26 日: 月之暗面 Kimi K3 从 API 首发到全面开放权重,2.8T MoE、100 万 token 上下文,改写开源赛道格局。详见本站 K3 全面开源解读。
- 7 月 28 日: 马斯克回复 @rauchg 推文,预告 Grok 4.6 约 8 月 7 日(1.5T,SFT/RL 后训练重点)与 Grok 4.7 约 8 月下旬至 9 月初(2.1T,更强但更慢)。同日,1100+ 名科技员工联署 《Pacing the Frontier》 公开信,呼吁放缓前沿模型竞赛节奏——与 xAI「20 天一代」的迭代叙事形成张力。
- 7 月 30 日(本文撰写日): xAI 尚未发布 4.6 技术报告、定价或 benchmark;一切规格以马斯克推文为唯一公开来源,待官方核实。
01Grok 4.6 已知与待核实规格
下表区分「已证实」(Grok 4.5 官方数据)与「预告/未证实」(马斯克 7 月 28 日推文)。4.6 行在 xAI 正式公告前均视为传闻。
| 项目 | Grok 4.5(已证实) | Grok 4.6(预告,待核实) | Grok 4.7(预告,待核实) |
|---|---|---|---|
| 发布日期 | 2026-07-08 | 约 2026-08-07 | 2026-08 下旬 – 09 月初 |
| 参数量 | 未公开(MoE) | 约 1.5T | 约 2.1T |
| 后训练重点 | Cursor 联合训练、Agent 优化 | SFT + RL 大幅升级 | 更大规模,速度更慢 |
| 上下文窗口 | 500K token | 未公布 | 未公布 |
| API 定价 | $2 / $6 per M | 未公布 | 未公布 |
| Terminal-Bench 2.1 | 83.3% | — | — |
| SWE-Bench Pro | 64.7% | — | — |
马斯克强调 4.6 的增益主要来自后训练管线(SFT 与 RL),而非单纯扩大预训练——若属实,编程 Agent 与工作流完成率可能是首要受益场景,但需等独立 benchmark 验证。
痛点追逐「马斯克时间表」的选型陷阱
- 推文 ≠ 产品公告: 4.6 尚无 xAI 博客、changelog 或 API 模型 ID;把 8 月 7 日写进生产排期,历史上有过多次滑期先例。
- 极速迭代下的技术债: Grok 4.5 发布仅 20 天即预告下一代,团队若刚完成 Cursor / OpenRouter 接入与 Prompt 调优,可能面临两周内二次迁移成本。
- 参数叙事误导: 1.5T 与 Kimi K3 的 2.8T 不能直接对比——MoE 激活参数、后训练质量与上下文长度才决定实用价值;参数量 alone 不说明问题。
- 速度与能力的 trade-off: 马斯克明确 4.7「更好但更慢」——若 4.6 为保速度妥协规模,高频 Agent CI 场景需提前定义「延迟 SLA」而非只看榜单。
- 闭源 vs 开放权重: xAI 全线闭源 API;Kimi K3 已开放 2.8T 权重。合规、数据驻留与供应商锁定风险需并行评估。
- 行业节奏压力: 同期 GPT-6 白宫游说、《Pacing the Frontier》呼吁减速——盲目跟进每一代 Grok 可能放大预算波动与验证人力缺口。
02竞品对比:Grok 4.5 现状与 4.6 预期定位
4.6 尚无跑分。下表以当前可引用数据对比 Grok 4.5、Kimi K3 与 Claude Fable 5.1 级前沿,供判断 4.6 需超越的基准线。
| 模型 | 参数量 | 上下文 | SWE-Bench Pro | Terminal-Bench 2.1 | 接入形态 |
|---|---|---|---|---|---|
| Grok 4.5 | 未公开 MoE | 500K | 64.7% | 83.3% | 闭源 API / Cursor |
| Kimi K3 | 2.8T(开放权重) | 1M | 93.4%(Vals AI Verified) | — | API + 自部署 |
| Claude Fable 5.1 | 未公开 | 200K+ | ~80% 级(Fable 5 约 80.4%) | 84.3%(Fable 5) | 闭源 API |
| Grok 4.6(预告) | ~1.5T(待核实) | 未公布 | — | — | 预计闭源 API |
定价与单次任务成本(4.5 已证实)
| 模型 | 输入 / 输出(per M) | 编程 Agent 单次成本(参考) |
|---|---|---|
| Grok 4.5 | $2 / $6 | 约 $2.49 / 任务 |
| Kimi K3 | $0.30(缓存)– $3 / $15 | 约 $0.95 / 任务(Intelligence Index 口径) |
| Claude Fable 5 | 更高档 | 约 $11.80 / 任务 |
| Grok 4.6 | 未公布 | — |
03Grok 4.7:更大、更慢的第二波
马斯克在同一线程中把 4.7 定位为 4.6 之后的「能力版」:参数量约 2.1T,推理更慢但质量更高,窗口落在 8 月下旬至 9 月初。这意味着 xAI 可能在 8 月内连续投放两个版本——类似「Fast / Max」双 SKU 策略,但具体命名与 API 模型 ID 均未公布。
对企业用户,更合理的预期是:4.6 服务延迟敏感的高频 Agent(CI 修 bug、终端任务),4.7 服务质量敏感的长推理(架构设计、复杂重构)。在官方 benchmark 出来前,不宜假设 4.7 一定全面超越 Kimi K3 或 Claude Opus 5 级模型。
04六步 Runbook:Grok 4.6 发布前准备
-
01
固化 Grok 4.5 基线:记录当前 Cursor / API 任务的 SWE-Bench 类冒烟用例、单次 Token 消耗与延迟 P95,作为 4.6 上线后的 A/B 对照。参考本站 4.5 完整 benchmark 拆解。
-
02
订阅官方渠道而非仅看推文:关注 xAI changelog、
api.x.ai模型列表与 Grok Build 公告;8 月 7 日前后设置告警,避免依赖社交媒体二次转载。 -
03
设计双模型路由草案:预留 4.6(快)/ 4.7(强)/ Kimi K3(长上下文开源)三路由配置;在独立 benchmark 公布前勿关闭 4.5 生产流量。
-
04
预算弹性区间:按 4.5 的 $2/$6 估算 8 月用量,并为可能涨价或「更强档」单独计价预留 15–25% 缓冲;对照 NUKCLOUD 定价页 核算 Agent 宿主与 CI 固定成本。
-
05
独立验证而非厂商自报:4.6 发布后优先等 Vals AI、Artificial Analysis 等第三方 SWE-Bench / Terminal-Bench 复测,再决定是否迁移核心流水线。
-
06
评估行业节奏风险:阅读 《Pacing the Frontier》 背景与团队 Burnout 阈值;若 20 天一代超出组织消化能力,主动冻结「必跟最新 Grok」策略,改走季度级模型评审。
05总结与 FAQ
Grok 4.6 是 2026 年 7 月 AI 圈「最快迭代」叙事的又一注脚:马斯克在 4.5 上线 20 天后即预告 1.5T + SFT/RL 强化版与 2.1T 的 4.7 双轨路线。对工程团队,关键不是抢跑 8 月 7 日,而是建立可复现基线、等待独立 benchmark,并在闭源 Grok 与 开放权重 K3 之间保持路由弹性。
高频 Grok Agent 跑在共享 VPS 或超卖云主机上时,邻居 CPU 争抢、SSH 长连接中断与构建队列抖动会迅速吃掉模型降价收益。对需要稳定终端 Bench 与 CI 平面的团队,NUKCLOUD 多区域裸金属 Mac / 云端 Mac 节点提供独占 Apple Silicon 算力与清晰租户边界,可在 定价页 对照规格并经 下单页 试跑 Agent 宿主环境。
数据截至 2026-07-30。来源:马斯克 X 推文(回复 @rauchg)、xAI Grok 4.5 官方材料、本站 Grok 4.5 评测、Kimi K3 报道。4.6 / 4.7 规格均为预告级信息,发布前请以官方最新数据为准。