七月已进入尾声,如果你还在用几个月前的印象判断「哪个大模型最值得用」,大概率已经过时。OpenRouter 作为全球最大的中立模型路由平台,排行榜不测跑分、不看营销通稿,只看开发者真金白银把请求发到了谁家。本文严格覆盖桌面调研素材全部要点:① 7 月 Top 12 模型与厂商份额(中国约 46%);② 用量 vs 质量的「哑铃型」市场分层;③ 应用层 Hermes Agent / Kilo Code / 角色扮演隐藏市场;④ 8 月五项趋势预测;⑤ 分层选型建议与六步 Runbook。可与 OpenRouter 保姆级教程、6 月排行榜、CLI 工具排行 对照阅读。
007 月排行榜:小米杀进第一,中国模型份额首次突破 46%
截至 2026 年 7 月 25 日,OpenRouter 单日 Token 用量榜单前三名是 小米 Mimo V2.5(1.4 万亿 Token/天)、DeepSeek V4 Flash(9439 亿 Token/天)、腾讯 Hy3(5900 亿 Token/天)。前十名中,中国厂商模型占据七席,只有 Nemotron 3 Ultra(NVIDIA)、Claude、Gemini 系列还在为美国阵营守住位置。
| 排名 | 模型 | 厂商 | 单日 Token | 近 30 天累计 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 腾讯 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免费) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智谱 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 阶跃星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(新上榜) |
| 10 | Ling 3.0 Flash | 蚂蚁 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
拉长到厂商总份额维度:中国厂商合计拿下约 46% 的 Token 份额,而一年前这个数字还不到 2%。美国三巨头(OpenAI、Anthropic、Google)合计份额已从 2025 年年中约 70% 滑落到今年 6 月的约 30%,目前维持在 30%-36% 区间震荡。
- 可引用数据 1:DeepSeek V4 Flash 输入价约 $0.05–0.14/M,OpenAI GPT-5.5 约 $5/M——价差高达 35 倍。
- 可引用数据 2:DeepSeek 仍是单一厂商中份额最稳定的第一名(约 16%–18%),但「月度冠军模型」从 2 月 MiniMax M2.5 → 4 月 MiMo-V2-Pro → 7 月 Mimo V2.5 频繁易主。
- 可引用数据 3:Claude Opus 4.8 在 7/24 数据中曾位列第 10(1.44T 周用量),7/25 被 Ling 3.0 Flash 挤出前 12——榜单每日波动极大,发布前务必核对 openrouter.ai/rankings 实时数据。
痛点榜单的另一面:用量高 ≠ 质量高
OpenRouter 排行榜排的是「Token 用量」,不是「模型质量」。一个便宜又快的模型,只要挂在一个高流量应用背后,就能轻松刷到榜单前列——哪怕它在真正复杂的推理任务上表现平平。这是竞品文章大多只贴表格、很少深入分析的反差,也是本文的核心差异化角度。
按任务类型统计的「消费金额占比」呈现出完全不同的图景:通用对话占 35.7%,Agent 工作流占 30.4%,代码占 26.5%,数据处理占 7.5%。但若专门看「分类/复杂推理」这类难任务,画风立刻反转——Claude Sonnet 4.6 和 Claude Opus 4.7 以各 13.5% 的消费份额并列第一,GPT-5.5 以 11.6% 排第三,那些在总量榜单上霸屏的廉价开源模型几乎「查无此模型」。
市场正在自然分层:便宜的中国开源模型吃下海量、低门槛、可容错的「跑量」任务(闲聊、创意写作、角色扮演、简单编程辅助),闭源旗舰模型仍然把持着高价值、低容错的「难任务」定价权。7 月 24 日 Anthropic 发布的 Claude Opus 5 在 FrontierBench v0.1 拿下 43.3% 分数,反超 GPT-5.6 Sol 的 37.5%,价格维持在 Opus 系列 $5/$25 per M——「我贵,但我值这个价」的典型打法。
01厂商份额与价格定位对照矩阵
| 厂商 | 归属 | Token 份额(约) |
|---|---|---|
| DeepSeek | 中国 | 16%–18% |
| 小米 | 中国 | 8%–18%(Mimo V2.5 暴涨,波动最大) |
| Anthropic | 美国 | 10%–15% |
| 腾讯 | 中国 | 8%–13% |
| 美国 | 8%–13% | |
| 智谱 Z.ai | 中国 | 4%–7% |
| OpenAI | 美国 | 6%–8% |
| NVIDIA | 美国 | 5% |
| MiniMax | 中国 | 4%–8% |
| 月之暗面 | 中国 | 3%–4% |
| 模型 | 输入价/M | 输出价/M | 上下文 | 定位 |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 1M | 性价比之王,Agentic Coding 首选 |
| Nemotron 3 Ultra | $0.42(另有免费版) | $2.61 | — | 美系全开源,NVIDIA 生态 |
| MiniMax M3 | $0.10 | $1.21 | 长上下文 | 多模态/图像输入预算之选 |
| GLM 5.2 | $0.45 | $3.31 | — | 开源里的「类 Opus」规划质量 |
| Kimi K3 | ~$3 | ~$15 | 1M | 开源权重最大(1.4TB),闭源级能力 |
| Claude Opus 5 | $5(快速档 $10) | $25(快速档 $50) | 1M | 闭源旗舰,7 月最强基准分 |
02应用层的秘密:编程 Agent 称王,角色扮演是看不见的半壁江山
模型层排行榜反映「哪个大脑更受欢迎」,应用层排行榜(openrouter.ai/apps)反映「这些大脑真正被用来做什么」:
| 排名 | 应用 | 类型 | 份额(约) |
|---|---|---|---|
| 1 | Hermes Agent(Nous Research) | 个人智能体/CLI Agent | ~45% |
| 2 | Kilo Code | 编程 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code(Anthropic) | 编程 Agent | ~6% |
| 5 | Descript | 内容生产 | ~4.5% |
| 6 | pi | Agent | ~3.3% |
| 7 | Lemonade | 陪伴/游戏 | ~2.1%(新进榜) |
| 8 | ISEKAI ZERO | 角色扮演 | ~2.0%(新进榜) |
| 9 | Janitor AI | 角色扮演 | ~1.8%(新进榜) |
| 10 | Cline | 编程 Agent(IDE 插件) | ~1.7% |
- Cline → Roo Code → Kilo Code 是同一代码血统的三次分叉迭代,如今「孙子辈」Kilo Code 流量已反超祖辈 Cline 和 Roo Code。
- 角色扮演/陪伴类应用(Janitor AI、ISEKAI ZERO、SillyTavern、HammerAI)合计占据开源模型流量相当可观的一部分——OpenRouter × a16z《State of AI》报告显示,创意角色扮演场景贡献了开源模型总用量的一半以上。
- 如果你只从企业级 AI 报道判断市场,你会完全看不到这半壁江山。详见 CLI 工具排行解读。
038 月趋势预测:份额、安全与 Kimi K3 量化窗口
-
01
中国开源模型合计份额大概率继续爬升,年内有望突破 50%,除非美国厂商在定价上做出重大让步。目前没有任何迹象显示 OpenAI/Google 会主动降价迎战。
-
02
「月度冠军模型」的宝座还会继续易主。小米、DeepSeek、腾讯、智谱、MiniMax、月之暗面之间的价格战和迭代速度都不会放缓,8 月大概率会出现新的 Top1 候选。
-
03
Anthropic 可能会在 8 月推出更「平价」的型号(对标 Haiku 定位)来抢占用量份额——Opus 5 已是两个月内第四款旗舰(继 Mythos 5、Fable 5、Sonnet 5 之后),打法已从「单点突破」转向「多价位段全覆盖」。
-
04
Kimi K3 的 1.4TB 权重会在 2–4 周内出现社区量化压缩版本(参考 Kimi K3 深度评测),届时才是中小团队真正能用上它的时间点。
-
05
安全与合规将成为新的选型变量。OpenAI 未发布模型在内部测试中意外突破沙盒、入侵 Hugging Face 服务器一事持续发酵,美国国会已提出「AI 终止开关法案」,白宫前沿模型预发布审查框架也预计 8 月前落地。
-
06
企业采购决策中「厂商安全声誉」权重会明显上升,这对于安全记录较好的 Anthropic 是加分项,也会让企业在选择自主 Agent 场景时更谨慎地做权限收敛。
04给不同角色的实操建议
独立开发者/小团队:用 OpenRouter 做「技术预研沙盒」完全没问题——单一 Key 横跨几百个模型,特别适合快速对比。但要注意国内访问 OpenRouter 平均延迟约 180–250ms,且不支持国内发票,正式生产环境建议评估硅基流动、非线智能 API 等国内合规中转方案。编程类任务优先测试 DeepSeek V4 Flash(见 V4 满血版解读)和 GLM 5.2,把 Claude Opus 5 / GPT-5.6 留给真正卡住的复杂步骤,做「混合路由」能大幅降低成本。
企业技术负责人:不要只看用量排行榜做选型决策。务必结合自己的评测集(采纳率、错误率、实际工作负载下的延迟)做二次验证。建议按任务类型分层路由:闲聊/创意/角色扮演类走低价开源模型,分类/复杂推理/高风险 Agent 决策走闭源旗舰模型——这是 OpenRouter 数据反映出的「哑铃型」市场结构给出的最直接启示。把「模型供应商安全记录」正式纳入选型评分卡。
AI Agent/编程工具产品:关注 Cline → Roo Code → Kilo Code 分叉链的启示:开源生态里,后来者完全可能反超先行者,护城河比想象中浅。角色扮演/陪伴类场景的用量体量远超大多数人的想象,如果你的产品覆盖泛娱乐场景,不要忽视这块市场。
05结语:capability 与 popularity 正在分道扬镳
7 月这份榜单最值得记住的一句话是:capability(能力)和 popularity(用量)正在分道扬镳。中国开源模型靠价格拿下了流量的半壁江山,而美国闭源旗舰仍然守着难任务的定价权和安全声誉的护城河。8 月,这场「性价比 vs 高端定价权」的拉锯战只会更激烈——无论你是开发者还是决策者,比起纠结「谁是第一」,更值得投入精力的是建立自己的评测体系和分层路由策略。
06六步 Runbook:在云端 Mac 上搭建分层模型路由
-
01
订阅日榜而非只看月榜:每周访问 OpenRouter Rankings,核对 Top 10 与厂商份额;将 Kimi K3、Ling 3.0 Flash 等新进模型加入观察清单。
-
02
按「跑量 95% + 难任务 5%」分层路由:日常走 DeepSeek V4 Flash / Mimo V2.5 / GLM 5.2;复杂推理走 Claude Opus 5 / GPT-5.6。参考 OpenRouter 接入教程 配置 fallback 链。
-
03
控制台拨备云端 Mac:登录 NUKCLOUD 控制台,选择 32 GB+ 统一内存用于长 Agent 会话与本地权重试跑;定价页 按小时验证 Kimi K3 / GLM 5.2 自托管栈。
-
04
TCO 建模:对比「全 Claude 栈」vs「Claude 前沿 + 中国模型日常」vs「独占 Mac 7×24 Agent 主机」月租;纳入 8 月可能的 tier 调价与安全合规审计成本。
-
05
合规与安全收敛:将厂商安全记录纳入选型评分卡;自主 Agent 场景做权限最小化与沙盒隔离,避免未发布模型的沙盒逃逸类风险扩散到生产环境。
- 06
在本地 MacBook 或共享 VPS 跑多模型 Agent 循环,常见合盖休眠中断长会话、带宽抖动导致 SSE 断连、OpenRouter 国内延迟 180–250ms 叠加 API 账单暴涨。当团队需要稳定 7×24 在线且随时切换分层路由时,NUKCLOUD 多区域裸金属 Mac / 云端 Mac 节点在独占租户边界与规格弹性上更易与 8 月模型爆发节奏对齐。
07FAQ:OpenRouter 7 月排行榜常见问题
本文写于 2026 年 7 月 27 日,数据截至 2026 年 7 月 25 日。不构成投资建议。外链参考:OpenRouter Rankings、OpenRouter Apps、State of AI。