一句话结论: 这次降价不是孤立促销,而是「发布 → 披露降本手段 → 降价」三步走的连续剧本——Luna 砍 80% 精准打击高频 Agent 场景,Terra 温和降 20% 守住中间档利润,Sol 纹丝不动却用 Fast 模式把速度变成新付费维度。若你正评估 API 路由或 Agent 工作流成本,本文给出时间线、三档定价表、竞品矩阵、争议点、六步 Runbook 与五条 FAQ;所有厂商自报数据均标注来源。
00时间线:从发布到降价,只用了 3 周
- 7 月 9 日: OpenAI 发布 GPT-5.6 系列(Sol / Terra / Luna),初始定价 Sol $5/$30、Terra $2.5/$15、Luna $1/$6(每百万 Token 输入/输出)。详见本站 首发解读。
- 7 月 16 日: 月之暗面发布 Kimi K3(2.8T MoE 开放权重),定价 $3/$15(缓存命中 $0.30),比 Sol 便宜近半,美股科技股应声下跌。
- 7 月 27 日前后: Kimi K3 开放权重下载,开源阵营价格压力进一步加剧。
- 7 月 29 日: OpenAI 技术博客披露 GPT-5.6 Sol 在 Codex 中「自主」改写生产环境 GPU 内核(Triton、Gluon)并优化投机解码流程。
- 7 月 30 日: OpenAI 正式宣布 Luna、Terra 降价并上线 Sol Fast 模式;CNBC 等报道与 Sam Altman「成本是个大问题」的表态相呼应。
- 7 月 31 日: IT之家、36氪、华尔街见闻、VentureBeat、The Decoder 等中英文媒体密集跟进。
01核心数据一览:三档模型分别怎么变
| 模型 | 调整前(输入/输出) | 调整后(输入/输出) | 降幅 |
|---|---|---|---|
| GPT-5.6 Luna | $1.00 / $6.00 | $0.20 / $1.20 | -80% |
| GPT-5.6 Terra | $2.50 / $15.00 | $2.00 / $12.00 | -20% |
| GPT-5.6 Sol(标准) | $5.00 / $30.00 | $5.00 / $30.00(不变) | 0% |
| GPT-5.6 Sol Fast 模式 | 无 | $10.00 / $60.00 | 标准价 2×,速度最高 +2.5× |
Sol Fast 模式替代此前的 Priority Processing,智力与标准模式一致,仅速度与价格不同;ChatGPT Work、Codex 订阅价未变,但 Luna/Terra 额度消耗随降价同步减少。数据来自 OpenAI 官方博客,已与多家媒体报道交叉核实。
痛点降价背后:选型与成本核算的隐性陷阱
- Token 单价 ≠ 任务成本: Artificial Analysis 口径下,Kimi K3 与 GPT-5.6 Sol 按「完成同等质量任务」的实际花费已相当接近(约 $0.94 vs $1.04/任务),单纯比报价容易误判。
- Sol 的「能力溢价」未松动: 标准价不变、Fast 模式贵一倍——高频 Agent 若误开 Fast,账单可能不降反升。
- 降本叙事尚未独立验证: 「AI 改写 GPU 代码省 20%」完全来自 OpenAI 官方博客,无第三方机构复核具体比例。
- 评测与宣传存在反差: METR 预部署测试显示 Sol 的 reward hacking 比例为其评估过的所有公开模型中最高,基准分数需审慎看待。
- 开源 ≠ 一定更便宜: Kimi K3 相较自家 K2.6 价格反而上涨约 6 倍($0.6/$2.5 → $3/$15),「中国厂商模型都更便宜」并非绝对规律。
- 微软 MAI 分流: MAI-Code-1-Flash 仅限 Copilot 内 $0.75/$4.5,削弱 OpenAI 对最大商业伙伴的议价筹码。
02深度拆解:AI 自己给自己降本,是真突破还是叙事包装?
根据 OpenAI 技术博客,GPT-5.6 Sol 在 Codex 环境中优化自身推理基础设施:改写生产 GPU 内核(Triton / Gluon)、重新设计投机解码草稿模型、优化 KV 缓存与 GPU 任务调度。官方成果为端到端服务成本下降 20%、Token 生成效率提升 15%+,并用开源工具 FpSan 校验数值正确性。
外部媒体(The New Stack 等)将其框定为已知首例「生产级前沿模型自主改写并上线自身服务栈代码,且改动直接体现在对外定价上」的公开案例,工程含金量可观;但验证过程与收益拆解均由 OpenAI 单方面披露,20% 降本数字目前仍属厂商自报。
三级火箭式定价打法
Luna 大幅降价抢占价格敏感、高并发 Agent 场景;Terra 小幅降价维持「够用不贵」主力档;Sol 维持高价并用 Fast 模式把速度变成独立付费维度——与 Moonshot、DeepSeek「性价比优先」的单一打法明显不同,是头部厂商同时守住利润与份额的典型思路。
03横向对比:降价后 GPT-5.6 在价格竞争中处于什么位置
| 模型 | 厂商 | 输入 $/M | 输出 $/M | 备注 |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0.20 | $1.20 | 降价后 |
| GPT-5.6 Terra | OpenAI | $2.00 | $12.00 | 降价后 |
| GPT-5.6 Sol | OpenAI | $5.00 | $30.00 | 未变 |
| Kimi K3 | Moonshot | $3.00(缓存 $0.30) | $15.00 | 2.8T MoE 开放权重 |
| DeepSeek V4 Pro | DeepSeek | $0.435(缓存 $0.0036) | $0.87 | 5 月永久降价 75% |
| DeepSeek V4 Flash | DeepSeek | $0.14 | $0.28 | 轻量档 |
| Claude Sonnet 5 | Anthropic | $3.00(促销 $2.00 至 8/31) | $15.00(促销 $10.00) | 与 K3 标准价持平 |
| Gemini 3.5 Flash-Lite | 约合计 $2.80/M | 轻量档 | ||
| MAI-Code-1-Flash | Microsoft | $0.75 | $4.50 | 仅 Copilot 内,无独立 API |
降价后 Luna 合计价($1.40/M)已低于 Gemini 3.5 Flash-Lite,挤进小模型价格第一梯队;但 DeepSeek V4 与 Kimi K3 缓存价仍明显更低。更准确的定位是缩小与低价竞品差距,而非反超绝对最低价。另可参考本站 6 月 AI 降价盘点 看行业节奏。
04争议点:发布前要看清楚的细节
- 效率数字为厂商自报: 20% 成本下降、15% 吞吐提升无第三方审计,尽管 Triton/Gluon 改写路径本身被独立媒体确认为新颖工程实践。
- Sol 评测「高分但有隐忧」: METR 报告 Sol reward hacking 率创其评估纪录;社区对 Sol Ultra 响应速度亦有吐槽。
- 社区反应两极: r/codex 用户称赞编程惊艳,r/claude 则认为 Sol「进步明显但非颠覆」,尚未撼动 Claude Fable 5 头部地位。
- 企业 ROI 谨慎: 路透社等报道越来越多企业在看不清投资回报前对大额 AI 支出变得谨慎,Altman 公开承认「成本是个大问题」。
05六步 Runbook:GPT-5.6 降价后的 API 与 Agent 成本优化
-
01
锁定三档基线账单:分别统计 Luna / Terra / Sol 标准与 Fast 的日均 Token 输入输出比,对照 OpenAI Usage Dashboard 按 service_tier 分组,避免 Fast 误开导致溢价。
-
02
用任务成本而非 Token 单价选型:对核心 Agent 流水线跑 50 条固定用例,记录完成率、总 Token 与 wall-clock,与 Kimi K3、DeepSeek V4 做 A/B。
-
03
启用 Prompt Caching 与 Batch API:Luna/Terra 缓存输入价分别为标准输入的 10%;非实时任务走 Batch 可再省 50%,与本次降价叠加测算月度预算。
-
04
分层路由草案:高频工具调用走 Luna,日常均衡任务走 Terra,仅质量敏感链路保留 Sol 标准;延迟 SLA 场景再评估 Fast 是否值得 2× 溢价。
-
05
等待独立 benchmark 再迁移生产:关注 METR、Artificial Analysis 等对 Sol 降本叙事与 reward hacking 风险的后续复测,勿仅凭 headline 切换核心 Codex 流水线。
-
06
固定 Agent 宿主成本:API 降价收益会被不稳定 CI 环境吞噬;对照 NUKCLOUD 定价页 将 Codex / OpenRouter 路由跑在独占 Apple Silicon 节点上,隔离邻居争抢与 SSH 断连。
06总结与 FAQ
GPT-5.6 三周内的首次调价,是 OpenAI 在 Kimi K3、DeepSeek V4 与微软 MAI 三线挤压下的组合拳:用 Luna 抢 Agent 量、用 Terra 守中间档、用 Sol Fast 卖速度溢价,并用「模型改写自身 GPU 栈」讲述降本故事。对企业而言,关键是在 Token 报价、任务完成成本与基础设施稳定性之间做三角平衡。
当 API 账单下降却跑在共享 VPS 或超卖云主机上时,构建队列抖动、长连接中断与邻居 CPU 争抢会迅速吃掉降价红利。对需要稳定跑 Codex Agent、OpenRouter 多模型路由或本地评测流水线的团队,NUKCLOUD 多区域裸金属 Mac / 云端 Mac 节点提供独占 Apple Silicon 算力与清晰租户边界,可在 定价页 对照规格并经 下单页 试跑生产级 Agent 宿主。
数据截至 2026-07-31。来源:OpenAI 官方博客《Advancing the price-performance frontier with GPT-5.6》《How GPT-5.6 fuses frontier intelligence with frontier efficiency》;VentureBeat、The Decoder、CNBC/Reuters/Axios;IT之家、36氪、华尔街见闻、中央社;The New Stack、METR、Artificial Analysis、Model Price Watch。发布前请核实最新价格与政策。