阿里 Qwen3.8-Max 发布:2.4万亿参数冲进Arena全球前五,下周开源

2026 年 8 月 3 日,阿里巴巴正式 GA 新一代旗舰大模型千问 Qwen3.8-Max——2.4 万亿总参数950 亿激活100 万 token 上下文,Arena 文本竞技场暂列全球第五(1496 分,初步),视觉竞技场第二;同步上线 Agent 产品「千问办公」。官网已标「Open-Source」,权重却尚未释出。

一句话结论: Qwen3.8-Max 是阿里首次承诺开源 Max 级旗舰,在 Arena 文本前八名中为唯一非 Anthropic 模型,API 定价 $2/$6 明显低于 Claude Fable 5($10/$50);但截至 8 月 4 日权重尚未上线所有基准均为阿里自测,官网「Open-Source」标签早于实际释出。本文覆盖时间线、规格表、与 Kimi K3DeepSeek V4-Flash 横向对照、开源争议、六步 Runbook 与 FAQ,并链接 Apple Intelligence 中国版千问合作 背景。

00Qwen3.8-Max 是什么?

Qwen3.8-Max 是阿里巴巴千问团队发布的2.4 万亿参数稀疏 MoE 旗舰模型,基于 Qwen3.5 架构并引入混合注意力,每次推理激活约 950 亿参数,配备 100 万 token 超长上下文(思考模式下约 98.3 万,输出上限 13.1 万)与原生文字/图像/视频理解,专为长程 Agent 自主任务、程序开发与多模态知识工作设计。

规格数值
GA 日期2026 年 8 月 3 日
总参数 / 激活参数2.4 万亿(2.4T)/ 950 亿(95B)
架构稀疏 MoE + 混合注意力(基于 Qwen3.5)
上下文窗口1,048,576 tokens(1M)
输入模态文字、图像、视频
推理强度low / medium / xhigh(预设 xhigh)
API 定价输入 $2 / 输出 $6 每百万 token
国内定价输入 ¥12 / 输出 ¥36 每百万 token;缓存命中低至 ¥1.5
Arena 文本竞技场第 5 名,1496 分(Preliminary)
Arena 视觉竞技场第 2 名(仅次 Claude Fable 5)
开源权重承诺「下周」(约 8 月 10 日),截至发稿未上线
硬核资料 #1: Arena 文本竞技场前八名中,Qwen3.8-Max 是唯一挤进去的非 Anthropic 模型(1496 分,标注 Preliminary);视觉竞技场全球第二,仅次 Fable 5。

01发布时间线:从预览版到 GA,两周节奏极快

  • 7 月 16 日: 月之暗面发布 Kimi K3(2.8T 参数,896 专家激活 16 个),主打独立评测与透明技术报告。
  • 7 月 19 日: Qwen3.8-Max 以「预览版」先行开放,接入 Token Plan / Qoder / QoderWork,定价为正式价 10%,但未公布激活参数、未提供跑分表,服务条款禁止自动化生产环境调用。
  • 7 月 27 日: Kimi K3 按承诺开源权重,上线 Hugging Face,同步开源 MoonEP、FlashKDA 等基础设施。
  • 7 月 31 日: DeepSeek 发布 V4-Flash 正式版,参数规模不变前提下,9 项 Agent/程序基准均超 V4-Pro 预览版。
  • 8 月 3 日: Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」Agent 产品同步上线。当天阿里港股涨约 7%、美股涨约 4.5%。
  • 预计 8 月 10 日前后: Qwen3.8-Max 与精简版 Qwen3.8-27B 权重计划登陆 Hugging Face 与 ModelScope,具体日期与开源协议条款尚未公布。
硬核资料 #2: 2026 年 7 月国产大模型竞争进入「3T 俱乐部」——K3 以 2.8T 登顶开源规模纪录,Qwen3.8-Max 以 2.4T 回应;7 月 31 日 DeepSeek V4-Flash 则证明不靠堆参数也能大幅提升 Agent 能力,参数竞赛叙事正被架构效率竞赛取代。

02核心架构:大容量、低激活的 MoE 设计

Qwen3.8-Max 延续 Qwen3.5 的稀疏 MoE 路线,把总参数推到 2.4 万亿的同时,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4T 全量参数。这也是阿里能把 API 定价压到 $2/$6、明显低于 Claude Opus 5($5/$25)与 Fable 5($10/$50)的架构基础。

reasoning_effort 三档设计

模型提供 low / medium / xhigh 三档推理强度(预设 xhigh),开发者可按任务复杂度动态调节速度与深度取舍。可通过 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段调用。

长程自主任务与生态卡位

阿里展示案例包括:16 天无人工介入的自主编码项目、超过 500 步的芯片设计优化,以及自建 RecreationBench(黑盒环境下仅凭互动与视觉反馈还原真实应用)。Qwen3.8-Max 同步接入「千问办公」Agent 平台,API 兼容 OpenAI 与 Anthropic 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。

硬核资料 #3: 唯一可比的独立盲测中,269 个文件的真实项目架构设计任务——Kimi K3 得 83 分、Qwen3.8-Max 预览版得 80 分,差距极小,属同档位互有胜负而非全面碾压。

痛点选型时容易被忽略的隐性成本

  • 「Open-Source」标签早于权重: 官网 qwen.ai 在 GA 当天已标 Open-Source,但 Hugging Face 与 ModelScope 尚无仓库、许可证或确切上线时间,只有「下周」模糊承诺。
  • 基准均为阿里自测: PaperBench、QwenSWEBench、RecreationBench 等含多个内部基准,Artificial Analysis、Arena 官方团队尚未对 GA 版独立复现;Arena 1496 分标注 Preliminary。
  • 预览版透明度不足: 7 月 19 日预览版未公开激活参数、模型卡与安全评估,服务条款禁止自动化生产调用,多家独立评测机构曾建议勿迁移生产系统。
  • 竞品脚注暗指 fallback: 阿里对比表脚注写「Fable 5 结果可能涉及 fallback」,但未公开同等方法论细节供第三方复现。
  • 激活参数披露滞后: Kimi K3(约 500B)与 DeepSeek V4-Pro(490B)预览期即公开,Qwen3.8-Max 直到 GA 才补充 950B,是 7 月遭批「透明度不足」的主因之一。
  • 短板基准明确: SWE-bench Pro 67.7 落后 Fable 5 的 80.0;HLE 43.6 为旗舰中最低(Fable 5 为 53.3),不能全量路由到 Qwen3.8-Max。

03基准测试:阿里自报数据解读

基准测试Qwen3.8-MaxClaude Fable 5Claude Opus 4.8备注
PaperBench93.0较上代 +28.2(阿里自测)
OSWorld-Verified86.1阿里自测
SWE-bench Pro67.780.069.2阿里自测
HLE43.653.3旗舰中最低(阿里自测)
Arena 文本竞技场1496(#5)前列Preliminary;唯一非 Anthropic 前八
Arena 视觉竞技场#2#18 月 1 日快照

解读重点: PaperBench 93.0 与 OSWorld-Verified 86.1 展现 Agent 与桌面自动化潜力;SWE-bench Pro 与 HLE 仍明显落后 Fable 5。「稳压 GPT-5.6 Sol 和 Fable 5」等结论目前主要依赖阿里一面之词,需等开源权重落地与第三方复现后才能验证。

04定价:旗舰 API 的价格竞争力

模型输入($/M)输出($/M)缓存命中输入上下文权重状态
Qwen3.8-Max$2.00$6.00隐式 $0.25;显式写入 $2.5、读取 $0.171M承诺下周,未上线
Kimi K3$3.00$15.00$0.301M已开源(7/27)
Claude Fable 5$10.00$50.001M闭源
Claude Opus 5$5.00$25.001M闭源
DeepSeek V4-Flash见官方表见官方表1M已开源

Qwen3.8-Max 输出 $6/M 仅为 Kimi K3($15/M)的 40%、Fable 5($50/M)的 12%,对高频 Agent 长输出场景成本优势明显。国内定价:输入 ¥12/M、输出 ¥36/M、缓存命中低至 ¥1.5/M。

05四种接入方式

方法一 — QwenCloud API: 通过阿里云 Model Studio 取得 Key,兼容 OpenAI 与 Anthropic 两种接口协议,可直接替换 Claude Code、Codex 等工具的 base URL。

方法二 — 千问办公: GA 同步上线的 Agent 产品,对标腾讯 WorkBuddy 与 Moonshot Kimi Work,适合知识工作者端到端任务。

Anthropic 兼容接口快速接入(Python)
from anthropic import Anthropic

client = Anthropic(
    api_key="your_qwen_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.messages.create(
    model="qwen3.8-max",
    max_tokens=8192,
    messages=[{"role": "user", "content": "分析这段代码的性能瓶颈..."}],
    extra_body={"reasoning": {"effort": "xhigh"}}
)
print(response.content[0].text)

方法三 — Qoder / QoderWork: 阿里自家 Agent IDE 与工作台,预览期即已接入,GA 后定价恢复标准费率。

方法四 — 等下周开源权重: Qwen3.8-Max 完整版与 Qwen3.8-27B 精简版计划登陆 Hugging Face 与 ModelScope;完整版需多节点数据中心级硬件,27B 更适合本地 GPU 部署。

06横向对比:怎么选?

模型厂商总参数/激活定价(输入/输出)权重独立第三方评测
Qwen3.8-Max阿里巴巴2.4T / 95B$2 / $6未开源(承诺中)暂无
Kimi K3月之暗面2.8T / ~50B$3 / $15已开源(7/27)AA Index ≈ 57.11
DeepSeek V4-ProDeepSeek1.6T / 49B见官方表已开源SWE-bench Verified 80.6%
DeepSeek V4-FlashDeepSeek同 V4-Pro见官方表已开源9 项 Agent 基准超 V4-Pro
Claude Fable 5Anthropic未公开$10 / $50闭源Arena 文本 #1
场景推荐模型原因
成本敏感的高频 AgentQwen3.8-Max输出 $6/M,低于 K3 与 Fable 5
已开源权重自部署Kimi K32.8T 权重已上线 Hugging Face
复杂 Repo 修 Bug / 深度推理Claude Fable 5SWE-bench Pro 80.0、HLE 53.3 领先
架构效率优先、不堆参数DeepSeek V4-Flash参数不变、Agent 基准大幅提升
多模态 + 1M 上下文Qwen3.8-MaxArena 视觉 #2,原生视频理解
国行 iPhone AI 生态千问系列Apple Intelligence 中国版

07开源承诺与争议:标签比权重早到

这是阿里首次承诺开源 Max 级旗舰权重,与 Kimi K3、DeepSeek 系列一起构成国产大模型「头部厂商集体转向开放权重」格局。但截至 8 月 4 日,信息披露时间差值得警惕:

  • 官网已标「Open-Source」,Hugging Face / ModelScope 尚无对应仓库。
  • 所有跑分均来自阿里自建测试框架,Arena 1496 分标注 Preliminary。
  • 预览版阶段禁止自动化生产调用,模型卡与安全评估缺失。
  • Qwen 模型已通过 Apple Intelligence 中国版 进入数亿部 iPhone 的系统级 AI 能力。

这不代表 Qwen3.8-Max 性能不行——独立盲测显示它确实与 Kimi K3 同档位——但「跻身全球第一梯队」的结论需等开源权重落地、第三方平台跑分上线后才能真正验证。预计 8 月 10 日前后关注 Hugging Face 官方仓库与开源协议条款。

08六步 Runbook:Qwen3.8-Max API 上手

  1. 01
    注册 QwenCloud API Key:在阿里云 Model Studio 建立密钥,存入密钥管理器,勿提交到 Git。
  2. 02
    选择接口协议:已有 OpenAI 客户端可直接替换 base URL;Claude Code 使用者选 Anthropic 兼容端点并设定 reasoning.effort
  3. 03
    按任务选推理强度:简单子任务用 low/medium 换 latency;复杂 Agent 长程任务用 xhigh(预设),避免不必要的 Token 消耗。
  4. 04
    小规模冒烟测试:先用 1 万 token 级任务验证品质与延迟,再扩展到 1M 上下文整库调用;对照 Kimi K3 做盲测 A/B。
  5. 05
    接入 Agent Harness:指向 QwenCloud 兼容端点,在 CI 中记录 input/output token 与缓存命中率;FrontierSWE 级修 Bug 保留给 Fable 5。
  6. 06
    建立混合路由与成本监控:高频 Agent 走 Qwen3.8-Max($2/$6);深度推理走 Fable 5;对照 定价页 估算 Agent 宿主月度成本,在 下单页 锁定裸机 Mac 节点试跑。

09总结与 FAQ

Qwen3.8-Max 代表阿里在 2026 年 AI 竞赛中重新掌握叙事主动权的一次重要发布:Arena 文本前五、视觉第二、API 定价极具竞争力,并首次承诺 Max 级开源。但「Open-Source」标签早于权重、基准均为自测、HLE 与 SWE-bench Pro 仍落后 Fable 5——工程团队应以独立盲测与自家 A/B 为准,而非仅看发布会数字。

团队用 Qwen3.8-Max 驱动 Agent 对大型程序库长时调用时,仍需要稳定、可审计的本地开发与 CI 平面。共享分钟池、桌下 Mac 或超卖 VPS 上的带宽抖动、邻居 CPU 抢占与长连线中断,会迅速吃掉 Token 降价带来的收益。对更稳定的生产 Agent 主机与构建环境,NUKCLOUD 多区域裸机 Mac / 云端 Mac 节点提供独占 Apple Silicon 算力与清晰租户边界,可在 定价页 对照规格并经 下单页 试跑。

Qwen3.8-Max 现在能直接用吗?开源了没有?
API 已可通过 QwenCloud 调用,兼容 OpenAI 与 Anthropic 接口。权重尚未开源,官网虽标 Open-Source,Hugging Face / ModelScope 仓库预计 8 月 10 日前后公布,以官方公告为准。
Qwen3.8-Max 和 Kimi K3 到底谁更强?
尚无统一权威评测。独立盲测显示 K3 83 分、Qwen 预览版 80 分,同档位互有胜负。K3 优势在已开源与 AA 第三方数据;Qwen 优势在更低定价与更完整多模态。详见 K3 开源深度解析
2.4 万亿参数是不是普通开发者用不起?
2.4T 为 MoE 总参数,激活 950 亿,API 成本接近千亿级。本地部署完整版需多节点数据中心;更现实的选择是等待 Qwen3.8-27B 精简版开源。
阿里公布的跑分能信吗?
可作参考,不宜当定论。均为阿里自建框架,Arena 标注 Preliminary。建议关注第三方复测或在自家场景做 A/B。
这次发布对普通用户有什么影响?
开发者取得更便宜旗舰 API。消费端方面,Apple Intelligence 中国版 生成式 AI 基于千问模型,国行 iPhone 用户将在系统层面直接用到千问能力。
Agent CI 应跑在什么基础设施上?
长时 Qwen Agent 会话需要稳定 SSH、可预测磁盘 IO 与无邻居抢占算力。NUKCLOUD 独占 Mac 节点适合作 Agent 宿主与 CI 构建平面,避免共享池尾延迟吞噬 API 成本优势。可从 定价页 起步,下单页 开通试用。

资料截至 2026-08-04。来源:阿里云官方博客、QwenCloud 定价页、Arena.ai 公开排行榜(8 月 1 日快照)、独立分析 Apidog / Yotta Labs / TechNode。基准为阿里巴巴自报数据。