一句话结论: Qwen3.8-Max 是阿里首次承诺开源 Max 级旗舰,在 Arena 文本前八名中为唯一非 Anthropic 模型,API 定价 $2/$6 明显低于 Claude Fable 5($10/$50);但截至 8 月 4 日权重尚未上线、所有基准均为阿里自测,官网「Open-Source」标签早于实际释出。本文覆盖时间线、规格表、与 Kimi K3、DeepSeek V4-Flash 横向对照、开源争议、六步 Runbook 与 FAQ,并链接 Apple Intelligence 中国版千问合作 背景。
00Qwen3.8-Max 是什么?
Qwen3.8-Max 是阿里巴巴千问团队发布的2.4 万亿参数稀疏 MoE 旗舰模型,基于 Qwen3.5 架构并引入混合注意力,每次推理激活约 950 亿参数,配备 100 万 token 超长上下文(思考模式下约 98.3 万,输出上限 13.1 万)与原生文字/图像/视频理解,专为长程 Agent 自主任务、程序开发与多模态知识工作设计。
| 规格 | 数值 |
|---|---|
| GA 日期 | 2026 年 8 月 3 日 |
| 总参数 / 激活参数 | 2.4 万亿(2.4T)/ 950 亿(95B) |
| 架构 | 稀疏 MoE + 混合注意力(基于 Qwen3.5) |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 输入模态 | 文字、图像、视频 |
| 推理强度 | low / medium / xhigh(预设 xhigh) |
| API 定价 | 输入 $2 / 输出 $6 每百万 token |
| 国内定价 | 输入 ¥12 / 输出 ¥36 每百万 token;缓存命中低至 ¥1.5 |
| Arena 文本竞技场 | 第 5 名,1496 分(Preliminary) |
| Arena 视觉竞技场 | 第 2 名(仅次 Claude Fable 5) |
| 开源权重 | 承诺「下周」(约 8 月 10 日),截至发稿未上线 |
01发布时间线:从预览版到 GA,两周节奏极快
- 7 月 16 日: 月之暗面发布 Kimi K3(2.8T 参数,896 专家激活 16 个),主打独立评测与透明技术报告。
- 7 月 19 日: Qwen3.8-Max 以「预览版」先行开放,接入 Token Plan / Qoder / QoderWork,定价为正式价 10%,但未公布激活参数、未提供跑分表,服务条款禁止自动化生产环境调用。
- 7 月 27 日: Kimi K3 按承诺开源权重,上线 Hugging Face,同步开源 MoonEP、FlashKDA 等基础设施。
- 7 月 31 日: DeepSeek 发布 V4-Flash 正式版,参数规模不变前提下,9 项 Agent/程序基准均超 V4-Pro 预览版。
- 8 月 3 日: Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」Agent 产品同步上线。当天阿里港股涨约 7%、美股涨约 4.5%。
- 预计 8 月 10 日前后: Qwen3.8-Max 与精简版 Qwen3.8-27B 权重计划登陆 Hugging Face 与 ModelScope,具体日期与开源协议条款尚未公布。
02核心架构:大容量、低激活的 MoE 设计
Qwen3.8-Max 延续 Qwen3.5 的稀疏 MoE 路线,把总参数推到 2.4 万亿的同时,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4T 全量参数。这也是阿里能把 API 定价压到 $2/$6、明显低于 Claude Opus 5($5/$25)与 Fable 5($10/$50)的架构基础。
reasoning_effort 三档设计
模型提供 low / medium / xhigh 三档推理强度(预设 xhigh),开发者可按任务复杂度动态调节速度与深度取舍。可通过 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段调用。
长程自主任务与生态卡位
阿里展示案例包括:16 天无人工介入的自主编码项目、超过 500 步的芯片设计优化,以及自建 RecreationBench(黑盒环境下仅凭互动与视觉反馈还原真实应用)。Qwen3.8-Max 同步接入「千问办公」Agent 平台,API 兼容 OpenAI 与 Anthropic 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。
痛点选型时容易被忽略的隐性成本
- 「Open-Source」标签早于权重: 官网 qwen.ai 在 GA 当天已标 Open-Source,但 Hugging Face 与 ModelScope 尚无仓库、许可证或确切上线时间,只有「下周」模糊承诺。
- 基准均为阿里自测: PaperBench、QwenSWEBench、RecreationBench 等含多个内部基准,Artificial Analysis、Arena 官方团队尚未对 GA 版独立复现;Arena 1496 分标注 Preliminary。
- 预览版透明度不足: 7 月 19 日预览版未公开激活参数、模型卡与安全评估,服务条款禁止自动化生产调用,多家独立评测机构曾建议勿迁移生产系统。
- 竞品脚注暗指 fallback: 阿里对比表脚注写「Fable 5 结果可能涉及 fallback」,但未公开同等方法论细节供第三方复现。
- 激活参数披露滞后: Kimi K3(约 500B)与 DeepSeek V4-Pro(490B)预览期即公开,Qwen3.8-Max 直到 GA 才补充 950B,是 7 月遭批「透明度不足」的主因之一。
- 短板基准明确: SWE-bench Pro 67.7 落后 Fable 5 的 80.0;HLE 43.6 为旗舰中最低(Fable 5 为 53.3),不能全量路由到 Qwen3.8-Max。
03基准测试:阿里自报数据解读
| 基准测试 | Qwen3.8-Max | Claude Fable 5 | Claude Opus 4.8 | 备注 |
|---|---|---|---|---|
| PaperBench | 93.0 | — | — | 较上代 +28.2(阿里自测) |
| OSWorld-Verified | 86.1 | — | — | 阿里自测 |
| SWE-bench Pro | 67.7 | 80.0 | 69.2 | 阿里自测 |
| HLE | 43.6 | 53.3 | — | 旗舰中最低(阿里自测) |
| Arena 文本竞技场 | 1496(#5) | 前列 | — | Preliminary;唯一非 Anthropic 前八 |
| Arena 视觉竞技场 | #2 | #1 | — | 8 月 1 日快照 |
解读重点: PaperBench 93.0 与 OSWorld-Verified 86.1 展现 Agent 与桌面自动化潜力;SWE-bench Pro 与 HLE 仍明显落后 Fable 5。「稳压 GPT-5.6 Sol 和 Fable 5」等结论目前主要依赖阿里一面之词,需等开源权重落地与第三方复现后才能验证。
04定价:旗舰 API 的价格竞争力
| 模型 | 输入($/M) | 输出($/M) | 缓存命中输入 | 上下文 | 权重状态 |
|---|---|---|---|---|---|
| Qwen3.8-Max | $2.00 | $6.00 | 隐式 $0.25;显式写入 $2.5、读取 $0.17 | 1M | 承诺下周,未上线 |
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M | 已开源(7/27) |
| Claude Fable 5 | $10.00 | $50.00 | — | 1M | 闭源 |
| Claude Opus 5 | $5.00 | $25.00 | — | 1M | 闭源 |
| DeepSeek V4-Flash | 见官方表 | 见官方表 | — | 1M | 已开源 |
Qwen3.8-Max 输出 $6/M 仅为 Kimi K3($15/M)的 40%、Fable 5($50/M)的 12%,对高频 Agent 长输出场景成本优势明显。国内定价:输入 ¥12/M、输出 ¥36/M、缓存命中低至 ¥1.5/M。
05四种接入方式
方法一 — QwenCloud API: 通过阿里云 Model Studio 取得 Key,兼容 OpenAI 与 Anthropic 两种接口协议,可直接替换 Claude Code、Codex 等工具的 base URL。
方法二 — 千问办公: GA 同步上线的 Agent 产品,对标腾讯 WorkBuddy 与 Moonshot Kimi Work,适合知识工作者端到端任务。
from anthropic import Anthropic
client = Anthropic(
api_key="your_qwen_api_key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.messages.create(
model="qwen3.8-max",
max_tokens=8192,
messages=[{"role": "user", "content": "分析这段代码的性能瓶颈..."}],
extra_body={"reasoning": {"effort": "xhigh"}}
)
print(response.content[0].text)
方法三 — Qoder / QoderWork: 阿里自家 Agent IDE 与工作台,预览期即已接入,GA 后定价恢复标准费率。
方法四 — 等下周开源权重: Qwen3.8-Max 完整版与 Qwen3.8-27B 精简版计划登陆 Hugging Face 与 ModelScope;完整版需多节点数据中心级硬件,27B 更适合本地 GPU 部署。
06横向对比:怎么选?
| 模型 | 厂商 | 总参数/激活 | 定价(输入/输出) | 权重 | 独立第三方评测 |
|---|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 2.4T / 95B | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 月之暗面 | 2.8T / ~50B | $3 / $15 | 已开源(7/27) | AA Index ≈ 57.11 |
| DeepSeek V4-Pro | DeepSeek | 1.6T / 49B | 见官方表 | 已开源 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | DeepSeek | 同 V4-Pro | 见官方表 | 已开源 | 9 项 Agent 基准超 V4-Pro |
| Claude Fable 5 | Anthropic | 未公开 | $10 / $50 | 闭源 | Arena 文本 #1 |
| 场景 | 推荐模型 | 原因 |
|---|---|---|
| 成本敏感的高频 Agent | Qwen3.8-Max | 输出 $6/M,低于 K3 与 Fable 5 |
| 已开源权重自部署 | Kimi K3 | 2.8T 权重已上线 Hugging Face |
| 复杂 Repo 修 Bug / 深度推理 | Claude Fable 5 | SWE-bench Pro 80.0、HLE 53.3 领先 |
| 架构效率优先、不堆参数 | DeepSeek V4-Flash | 参数不变、Agent 基准大幅提升 |
| 多模态 + 1M 上下文 | Qwen3.8-Max | Arena 视觉 #2,原生视频理解 |
| 国行 iPhone AI 生态 | 千问系列 | 见 Apple Intelligence 中国版 |
07开源承诺与争议:标签比权重早到
这是阿里首次承诺开源 Max 级旗舰权重,与 Kimi K3、DeepSeek 系列一起构成国产大模型「头部厂商集体转向开放权重」格局。但截至 8 月 4 日,信息披露时间差值得警惕:
- 官网已标「Open-Source」,Hugging Face / ModelScope 尚无对应仓库。
- 所有跑分均来自阿里自建测试框架,Arena 1496 分标注 Preliminary。
- 预览版阶段禁止自动化生产调用,模型卡与安全评估缺失。
- Qwen 模型已通过 Apple Intelligence 中国版 进入数亿部 iPhone 的系统级 AI 能力。
这不代表 Qwen3.8-Max 性能不行——独立盲测显示它确实与 Kimi K3 同档位——但「跻身全球第一梯队」的结论需等开源权重落地、第三方平台跑分上线后才能真正验证。预计 8 月 10 日前后关注 Hugging Face 官方仓库与开源协议条款。
08六步 Runbook:Qwen3.8-Max API 上手
-
01
注册 QwenCloud API Key:在阿里云 Model Studio 建立密钥,存入密钥管理器,勿提交到 Git。
-
02
选择接口协议:已有 OpenAI 客户端可直接替换 base URL;Claude Code 使用者选 Anthropic 兼容端点并设定
reasoning.effort。 -
03
按任务选推理强度:简单子任务用 low/medium 换 latency;复杂 Agent 长程任务用 xhigh(预设),避免不必要的 Token 消耗。
-
04
小规模冒烟测试:先用 1 万 token 级任务验证品质与延迟,再扩展到 1M 上下文整库调用;对照 Kimi K3 做盲测 A/B。
-
05
接入 Agent Harness:指向 QwenCloud 兼容端点,在 CI 中记录 input/output token 与缓存命中率;FrontierSWE 级修 Bug 保留给 Fable 5。
- 06
09总结与 FAQ
Qwen3.8-Max 代表阿里在 2026 年 AI 竞赛中重新掌握叙事主动权的一次重要发布:Arena 文本前五、视觉第二、API 定价极具竞争力,并首次承诺 Max 级开源。但「Open-Source」标签早于权重、基准均为自测、HLE 与 SWE-bench Pro 仍落后 Fable 5——工程团队应以独立盲测与自家 A/B 为准,而非仅看发布会数字。
团队用 Qwen3.8-Max 驱动 Agent 对大型程序库长时调用时,仍需要稳定、可审计的本地开发与 CI 平面。共享分钟池、桌下 Mac 或超卖 VPS 上的带宽抖动、邻居 CPU 抢占与长连线中断,会迅速吃掉 Token 降价带来的收益。对更稳定的生产 Agent 主机与构建环境,NUKCLOUD 多区域裸机 Mac / 云端 Mac 节点提供独占 Apple Silicon 算力与清晰租户边界,可在 定价页 对照规格并经 下单页 试跑。
资料截至 2026-08-04。来源:阿里云官方博客、QwenCloud 定价页、Arena.ai 公开排行榜(8 月 1 日快照)、独立分析 Apidog / Yotta Labs / TechNode。基准为阿里巴巴自报数据。