阿里 Qwen3.8-Max 發布:2.4 萬億參數衝進 Arena 全球前五,下週開源

2026 年 8 月 3 日,阿里巴巴正式 GA 新一代旗艦大模型千問 Qwen3.8-Max——2.4 萬億總參數950 億激活100 萬 token 上下文,Arena 文本競技場暫列全球第五(1496 分,初步),視覺競技場第二;同步上線 Agent 產品「千問辦公」。官網已標「Open-Source」,權重卻尚未釋出。

一句話結論: Qwen3.8-Max 是阿里首次承諾開源 Max 級旗艦,在 Arena 文本前八名中為唯一非 Anthropic 模型,API 定價 $2/$6 明顯低於 Claude Fable 5($10/$50);但截至 8 月 4 日權重尚未上線所有基準均為阿里自測,官網「Open-Source」標籤早於實際釋出。本文覆蓋時間線、規格表、與 Kimi K3DeepSeek V4-Flash 橫向對照、開源爭議、六步 Runbook 與 FAQ,並連結 Apple Intelligence 中國版千問合作 背景。

00Qwen3.8-Max 是什麼?

Qwen3.8-Max 是阿里巴巴千問團隊發布的2.4 萬億參數稀疏 MoE 旗艦模型,基於 Qwen3.5 架構並引入混合注意力,每次推理激活約 950 億參數,配備 100 萬 token 超長上下文(思考模式下約 98.3 萬,輸出上限 13.1 萬)與原生文字/圖像/視訊理解,專為長程 Agent 自主任務、程式開發與多模態知識工作設計。

規格數值
GA 日期2026 年 8 月 3 日
總參數 / 激活參數2.4 萬億(2.4T)/ 950 億(95B)
架構稀疏 MoE + 混合注意力(基於 Qwen3.5)
上下文窗口1,048,576 tokens(1M)
輸入模態文字、圖像、視訊
推理強度low / medium / xhigh(預設 xhigh)
API 定價輸入 $2 / 輸出 $6 每百萬 token
國內定價輸入 ¥12 / 輸出 ¥36 每百萬 token;快取命中低至 ¥1.5
Arena 文本競技場第 5 名,1496 分(Preliminary)
Arena 視覺競技場第 2 名(僅次 Claude Fable 5)
開源權重承諾「下週」(約 8 月 10 日),截至發稿未上線
硬核資料 #1: Arena 文本競技場前八名中,Qwen3.8-Max 是唯一擠進去的非 Anthropic 模型(1496 分,標註 Preliminary);視覺競技場全球第二,僅次 Fable 5。

01發布時間線:從預覽版到 GA,兩週節奏極快

  • 7 月 16 日: 月之暗面發布 Kimi K3(2.8T 參數,896 專家激活 16 個),主打獨立評測與透明技術報告。
  • 7 月 19 日: Qwen3.8-Max 以「預覽版」先行開放,接入 Token Plan / Qoder / QoderWork,定價為正式價 10%,但未公布激活參數、未提供跑分表,服務條款禁止自動化生產環境呼叫。
  • 7 月 27 日: Kimi K3 按承諾開源權重,上線 Hugging Face,同步開源 MoonEP、FlashKDA 等基礎設施。
  • 7 月 31 日: DeepSeek 發布 V4-Flash 正式版,參數規模不變前提下,9 項 Agent/程式基準均超 V4-Pro 預覽版。
  • 8 月 3 日: Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」Agent 產品同步上線。當天阿里港股漲約 7%、美股漲約 4.5%。
  • 預計 8 月 10 日前後: Qwen3.8-Max 與精簡版 Qwen3.8-27B 權重計劃登陸 Hugging Face 與 ModelScope,具體日期與開源協議條款尚未公布。
硬核資料 #2: 2026 年 7 月國產大模型競爭進入「3T 俱樂部」——K3 以 2.8T 登頂開源規模紀錄,Qwen3.8-Max 以 2.4T 回應;7 月 31 日 DeepSeek V4-Flash 則證明不靠堆參數也能大幅提升 Agent 能力,參數競賽敘事正被架構效率競賽取代。

02核心架構:大容量、低激活的 MoE 設計

Qwen3.8-Max 延續 Qwen3.5 的稀疏 MoE 路線,把總參數推到 2.4 萬億的同時,實際激活量控制在 950 億——推理成本更接近千亿級模型,而非真正呼叫 2.4T 全量參數。這也是阿里能把 API 定價壓到 $2/$6、明顯低於 Claude Opus 5($5/$25)與 Fable 5($10/$50)的架構基礎。

reasoning_effort 三檔設計

模型提供 low / medium / xhigh 三檔推理強度(預設 xhigh),開發者可按任務複雜度動態調節速度與深度取捨。可透過 enable_thinking 參數或 Anthropic 相容介面的 reasoning.effort 欄位呼叫。

長程自主任務與生態卡位

阿里展示案例包括:16 天無人工介入的自主編碼專案、超過 500 步的晶片設計優化,以及自建 RecreationBench(黑盒環境下僅憑互動與視覺回饋還原真實應用)。Qwen3.8-Max 同步接入「千問辦公」Agent 平台,API 相容 OpenAI 與 Anthropic 兩種協定,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈。

硬核資料 #3: 唯一可比的獨立盲測中,269 個檔案的真實專案架構設計任務——Kimi K3 得 83 分、Qwen3.8-Max 預覽版得 80 分,差距極小,屬同檔位互有勝負而非全面碾壓。

痛點選型時容易被忽略的隱性成本

  • 「Open-Source」標籤早於權重: 官網 qwen.ai 在 GA 當天已標 Open-Source,但 Hugging Face 與 ModelScope 尚無倉庫、許可證或確切上線時間,只有「下週」模糊承諾。
  • 基準均為阿里自測: PaperBench、QwenSWEBench、RecreationBench 等含多個內部基準,Artificial Analysis、Arena 官方團隊尚未對 GA 版獨立復現;Arena 1496 分標註 Preliminary。
  • 預覽版透明度不足: 7 月 19 日預覽版未公開激活參數、模型卡與安全評估,服務條款禁止自動化生產呼叫,多家獨立評測機構曾建議勿遷移生產系統。
  • 競品腳註暗指 fallback: 阿里對比表腳註寫「Fable 5 結果可能涉及 fallback」,但未公開同等方法論細節供第三方復現。
  • 激活參數披露滯後: Kimi K3(約 500B)與 DeepSeek V4-Pro(490B)預覽期即公開,Qwen3.8-Max 直到 GA 才補充 950B,是 7 月遭批「透明度不足」的主因之一。
  • 短板基準明確: SWE-bench Pro 67.7 落後 Fable 5 的 80.0;HLE 43.6 為旗艦中最低(Fable 5 為 53.3),不能全量路由到 Qwen3.8-Max。

03基準測試:阿里自報數據解讀

基準測試Qwen3.8-MaxClaude Fable 5Claude Opus 4.8備註
PaperBench93.0較上代 +28.2(阿里自測)
OSWorld-Verified86.1阿里自測
SWE-bench Pro67.780.069.2阿里自測
HLE43.653.3旗艦中最低(阿里自測)
Arena 文本競技場1496(#5)前列Preliminary;唯一非 Anthropic 前八
Arena 視覺競技場#2#18 月 1 日快照

解讀重點: PaperBench 93.0 與 OSWorld-Verified 86.1 展現 Agent 與桌面自動化潛力;SWE-bench Pro 與 HLE 仍明顯落後 Fable 5。「穩壓 GPT-5.6 Sol 和 Fable 5」等結論目前主要依賴阿里一面之詞,需等開源權重落地與第三方復現後才能驗證。

04定價:旗艦 API 的價格競爭力

模型輸入($/M)輸出($/M)快取命中輸入上下文權重狀態
Qwen3.8-Max$2.00$6.00隱式 $0.25;顯式寫入 $2.5、讀取 $0.171M承諾下週,未上線
Kimi K3$3.00$15.00$0.301M已開源(7/27)
Claude Fable 5$10.00$50.001M閉源
Claude Opus 5$5.00$25.001M閉源
DeepSeek V4-Flash見官方表見官方表1M已開源

Qwen3.8-Max 輸出 $6/M 僅為 Kimi K3($15/M)的 40%、Fable 5($50/M)的 12%,對高頻 Agent 長輸出場景成本優勢明顯。國內定價:輸入 ¥12/M、輸出 ¥36/M、快取命中低至 ¥1.5/M。

05四種接入方式

方法一 — QwenCloud API: 透過阿里雲 Model Studio 取得 Key,相容 OpenAI 與 Anthropic 兩種介面協定,可直接替換 Claude Code、Codex 等工具的 base URL。

方法二 — 千問辦公: GA 同步上線的 Agent 產品,對標騰訊 WorkBuddy 與 Moonshot Kimi Work,適合知識工作者端到端任務。

Anthropic 相容介面快速接入(Python)
from anthropic import Anthropic

client = Anthropic(
    api_key="your_qwen_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.messages.create(
    model="qwen3.8-max",
    max_tokens=8192,
    messages=[{"role": "user", "content": "分析這段程式碼的效能瓶頸..."}],
    extra_body={"reasoning": {"effort": "xhigh"}}
)
print(response.content[0].text)

方法三 — Qoder / QoderWork: 阿里自家 Agent IDE 與工作台,預覽期即已接入,GA 後定價恢復標準費率。

方法四 — 等下週開源權重: Qwen3.8-Max 完整版與 Qwen3.8-27B 精簡版計劃登陸 Hugging Face 與 ModelScope;完整版需多節點資料中心級硬體,27B 更適合本地 GPU 部署。

06橫向對比:怎麼選?

模型廠商總參數/激活定價(輸入/輸出)權重獨立第三方評測
Qwen3.8-Max阿里巴巴2.4T / 95B$2 / $6未開源(承諾中)暫無
Kimi K3月之暗面2.8T / ~50B$3 / $15已開源(7/27)AA Index ≈ 57.11
DeepSeek V4-ProDeepSeek1.6T / 49B見官方表已開源SWE-bench Verified 80.6%
DeepSeek V4-FlashDeepSeek同 V4-Pro見官方表已開源9 項 Agent 基準超 V4-Pro
Claude Fable 5Anthropic未公開$10 / $50閉源Arena 文本 #1
場景推薦模型原因
成本敏感的高頻 AgentQwen3.8-Max輸出 $6/M,低於 K3 與 Fable 5
已開源權重自部署Kimi K32.8T 權重已上線 Hugging Face
複雜 Repo 修 Bug / 深度推理Claude Fable 5SWE-bench Pro 80.0、HLE 53.3 領先
架構效率優先、不堆參數DeepSeek V4-Flash參數不變、Agent 基準大幅提升
多模態 + 1M 上下文Qwen3.8-MaxArena 視覺 #2,原生視訊理解
國行 iPhone AI 生態千問系列Apple Intelligence 中國版

07開源承諾與爭議:標籤比權重早到

這是阿里首次承諾開源 Max 級旗艦權重,與 Kimi K3、DeepSeek 系列一起構成國產大模型「頭部廠商集體轉向開放權重」格局。但截至 8 月 4 日,信息披露時間差值得警惕:

  • 官網已標「Open-Source」,Hugging Face / ModelScope 尚無對應倉庫。
  • 所有跑分均來自阿里自建測試框架,Arena 1496 分標註 Preliminary。
  • 預覽版階段禁止自動化生產呼叫,模型卡與安全評估缺失。
  • Qwen 模型已透過 Apple Intelligence 中國版 進入數億部 iPhone 的系統級 AI 能力。

這不代表 Qwen3.8-Max 性能不行——獨立盲測顯示它確實與 Kimi K3 同檔位——但「躋身全球第一梯隊」的結論需等開源權重落地、第三方平台跑分上線後才能真正驗證。預計 8 月 10 日前後關注 Hugging Face 官方倉庫與開源協議條款。

08六步 Runbook:Qwen3.8-Max API 上手

  1. 01
    註冊 QwenCloud API Key:在阿里雲 Model Studio 建立金鑰,存入金鑰管理器,勿提交到 Git。
  2. 02
    選擇介面協定:已有 OpenAI 客戶端可直接替換 base URL;Claude Code 使用者選 Anthropic 相容端點並設定 reasoning.effort
  3. 03
    按任務選推理強度:簡單子任務用 low/medium 換 latency;複雜 Agent 長程任務用 xhigh(預設),避免不必要的 Token 消耗。
  4. 04
    小規模冒煙測試:先用 1 萬 token 級任務驗證品質與延遲,再擴展到 1M 上下文整庫呼叫;對照 Kimi K3 做盲測 A/B。
  5. 05
    接入 Agent Harness:指向 QwenCloud 相容端點,在 CI 中記錄 input/output token 與快取命中率;FrontierSWE 級修 Bug 保留給 Fable 5。
  6. 06
    建立混合路由與成本監控:高頻 Agent 走 Qwen3.8-Max($2/$6);深度推理走 Fable 5;對照 定價頁 估算 Agent 宿主月度成本,在 下單頁 鎖定裸機 Mac 節點試跑。

09總結與 FAQ

Qwen3.8-Max 代表阿里在 2026 年 AI 競賽中重新掌握敘事主動權的一次重要發布:Arena 文本前五、視覺第二、API 定價極具競爭力,並首次承諾 Max 級開源。但「Open-Source」標籤早於權重、基準均為自測、HLE 與 SWE-bench Pro 仍落後 Fable 5——工程團隊應以獨立盲測與自家 A/B 為準,而非僅看發布會數字。

團隊用 Qwen3.8-Max 驅動 Agent 對大型程式庫長時呼叫時,仍需要穩定、可稽核的本地開發與 CI 平面。共享分鐘池、桌下 Mac 或超賣 VPS 上的頻寬抖動、鄰居 CPU 搶佔與長連線中斷,會迅速吃掉 Token 降價帶來的收益。對更穩定的生產 Agent 主機與建置環境,NUKCLOUD 多區域裸機 Mac / 雲端 Mac 節點提供獨佔 Apple Silicon 算力與清晰租戶邊界,可在 定價頁 對照規格並經 下單頁 試跑。

Qwen3.8-Max 現在能直接用嗎?開源了沒有?
API 已可透過 QwenCloud 呼叫,相容 OpenAI 與 Anthropic 介面。權重尚未開源,官網雖標 Open-Source,Hugging Face / ModelScope 倉庫預計 8 月 10 日前後公布,以官方公告為準。
Qwen3.8-Max 和 Kimi K3 到底誰更強?
尚無統一權威評測。獨立盲測顯示 K3 83 分、Qwen 預覽版 80 分,同檔位互有勝負。K3 優勢在已開源與 AA 第三方數據;Qwen 優勢在更低定價與更完整多模態。詳見 K3 開源深度解析
2.4 萬億參數是不是普通開發者用不起?
2.4T 為 MoE 總參數,激活 950 億,API 成本接近千亿級。本地部署完整版需多節點資料中心;更現實的選擇是等待 Qwen3.8-27B 精簡版開源。
阿里公布的跑分能信嗎?
可作參考,不宜當定論。均為阿里自建框架,Arena 標註 Preliminary。建議關注第三方復測或在自家場景做 A/B。
這次發布對普通用戶有什麼影響?
開發者取得更便宜旗艦 API。消費端方面,Apple Intelligence 中國版 生成式 AI 基於千問模型,國行 iPhone 用戶將在系統層面直接用到千問能力。
Agent CI 應跑在什麼基礎設施上?
長時 Qwen Agent 會話需要穩定 SSH、可預測磁碟 IO 與無鄰居搶佔算力。NUKCLOUD 獨佔 Mac 節點適合作為 Agent 宿主與 CI 建置平面,避免共享池尾延遲吞噬 API 成本優勢。可從 定價頁 起步,下單頁 開通試用。

資料截至 2026-08-04。來源:阿里雲官方博客、QwenCloud 定價頁、Arena.ai 公開排行榜(8 月 1 日快照)、獨立分析 Apidog / Yotta Labs / TechNode。基準為阿里巴巴自報數據。