一句話結論: Qwen3.8-Max 是阿里首次承諾開源 Max 級旗艦,在 Arena 文本前八名中為唯一非 Anthropic 模型,API 定價 $2/$6 明顯低於 Claude Fable 5($10/$50);但截至 8 月 4 日權重尚未上線、所有基準均為阿里自測,官網「Open-Source」標籤早於實際釋出。本文覆蓋時間線、規格表、與 Kimi K3、DeepSeek V4-Flash 橫向對照、開源爭議、六步 Runbook 與 FAQ,並連結 Apple Intelligence 中國版千問合作 背景。
00Qwen3.8-Max 是什麼?
Qwen3.8-Max 是阿里巴巴千問團隊發布的2.4 萬億參數稀疏 MoE 旗艦模型,基於 Qwen3.5 架構並引入混合注意力,每次推理激活約 950 億參數,配備 100 萬 token 超長上下文(思考模式下約 98.3 萬,輸出上限 13.1 萬)與原生文字/圖像/視訊理解,專為長程 Agent 自主任務、程式開發與多模態知識工作設計。
| 規格 | 數值 |
|---|---|
| GA 日期 | 2026 年 8 月 3 日 |
| 總參數 / 激活參數 | 2.4 萬億(2.4T)/ 950 億(95B) |
| 架構 | 稀疏 MoE + 混合注意力(基於 Qwen3.5) |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 輸入模態 | 文字、圖像、視訊 |
| 推理強度 | low / medium / xhigh(預設 xhigh) |
| API 定價 | 輸入 $2 / 輸出 $6 每百萬 token |
| 國內定價 | 輸入 ¥12 / 輸出 ¥36 每百萬 token;快取命中低至 ¥1.5 |
| Arena 文本競技場 | 第 5 名,1496 分(Preliminary) |
| Arena 視覺競技場 | 第 2 名(僅次 Claude Fable 5) |
| 開源權重 | 承諾「下週」(約 8 月 10 日),截至發稿未上線 |
01發布時間線:從預覽版到 GA,兩週節奏極快
- 7 月 16 日: 月之暗面發布 Kimi K3(2.8T 參數,896 專家激活 16 個),主打獨立評測與透明技術報告。
- 7 月 19 日: Qwen3.8-Max 以「預覽版」先行開放,接入 Token Plan / Qoder / QoderWork,定價為正式價 10%,但未公布激活參數、未提供跑分表,服務條款禁止自動化生產環境呼叫。
- 7 月 27 日: Kimi K3 按承諾開源權重,上線 Hugging Face,同步開源 MoonEP、FlashKDA 等基礎設施。
- 7 月 31 日: DeepSeek 發布 V4-Flash 正式版,參數規模不變前提下,9 項 Agent/程式基準均超 V4-Pro 預覽版。
- 8 月 3 日: Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」Agent 產品同步上線。當天阿里港股漲約 7%、美股漲約 4.5%。
- 預計 8 月 10 日前後: Qwen3.8-Max 與精簡版 Qwen3.8-27B 權重計劃登陸 Hugging Face 與 ModelScope,具體日期與開源協議條款尚未公布。
02核心架構:大容量、低激活的 MoE 設計
Qwen3.8-Max 延續 Qwen3.5 的稀疏 MoE 路線,把總參數推到 2.4 萬億的同時,實際激活量控制在 950 億——推理成本更接近千亿級模型,而非真正呼叫 2.4T 全量參數。這也是阿里能把 API 定價壓到 $2/$6、明顯低於 Claude Opus 5($5/$25)與 Fable 5($10/$50)的架構基礎。
reasoning_effort 三檔設計
模型提供 low / medium / xhigh 三檔推理強度(預設 xhigh),開發者可按任務複雜度動態調節速度與深度取捨。可透過 enable_thinking 參數或 Anthropic 相容介面的 reasoning.effort 欄位呼叫。
長程自主任務與生態卡位
阿里展示案例包括:16 天無人工介入的自主編碼專案、超過 500 步的晶片設計優化,以及自建 RecreationBench(黑盒環境下僅憑互動與視覺回饋還原真實應用)。Qwen3.8-Max 同步接入「千問辦公」Agent 平台,API 相容 OpenAI 與 Anthropic 兩種協定,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈。
痛點選型時容易被忽略的隱性成本
- 「Open-Source」標籤早於權重: 官網 qwen.ai 在 GA 當天已標 Open-Source,但 Hugging Face 與 ModelScope 尚無倉庫、許可證或確切上線時間,只有「下週」模糊承諾。
- 基準均為阿里自測: PaperBench、QwenSWEBench、RecreationBench 等含多個內部基準,Artificial Analysis、Arena 官方團隊尚未對 GA 版獨立復現;Arena 1496 分標註 Preliminary。
- 預覽版透明度不足: 7 月 19 日預覽版未公開激活參數、模型卡與安全評估,服務條款禁止自動化生產呼叫,多家獨立評測機構曾建議勿遷移生產系統。
- 競品腳註暗指 fallback: 阿里對比表腳註寫「Fable 5 結果可能涉及 fallback」,但未公開同等方法論細節供第三方復現。
- 激活參數披露滯後: Kimi K3(約 500B)與 DeepSeek V4-Pro(490B)預覽期即公開,Qwen3.8-Max 直到 GA 才補充 950B,是 7 月遭批「透明度不足」的主因之一。
- 短板基準明確: SWE-bench Pro 67.7 落後 Fable 5 的 80.0;HLE 43.6 為旗艦中最低(Fable 5 為 53.3),不能全量路由到 Qwen3.8-Max。
03基準測試:阿里自報數據解讀
| 基準測試 | Qwen3.8-Max | Claude Fable 5 | Claude Opus 4.8 | 備註 |
|---|---|---|---|---|
| PaperBench | 93.0 | — | — | 較上代 +28.2(阿里自測) |
| OSWorld-Verified | 86.1 | — | — | 阿里自測 |
| SWE-bench Pro | 67.7 | 80.0 | 69.2 | 阿里自測 |
| HLE | 43.6 | 53.3 | — | 旗艦中最低(阿里自測) |
| Arena 文本競技場 | 1496(#5) | 前列 | — | Preliminary;唯一非 Anthropic 前八 |
| Arena 視覺競技場 | #2 | #1 | — | 8 月 1 日快照 |
解讀重點: PaperBench 93.0 與 OSWorld-Verified 86.1 展現 Agent 與桌面自動化潛力;SWE-bench Pro 與 HLE 仍明顯落後 Fable 5。「穩壓 GPT-5.6 Sol 和 Fable 5」等結論目前主要依賴阿里一面之詞,需等開源權重落地與第三方復現後才能驗證。
04定價:旗艦 API 的價格競爭力
| 模型 | 輸入($/M) | 輸出($/M) | 快取命中輸入 | 上下文 | 權重狀態 |
|---|---|---|---|---|---|
| Qwen3.8-Max | $2.00 | $6.00 | 隱式 $0.25;顯式寫入 $2.5、讀取 $0.17 | 1M | 承諾下週,未上線 |
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M | 已開源(7/27) |
| Claude Fable 5 | $10.00 | $50.00 | — | 1M | 閉源 |
| Claude Opus 5 | $5.00 | $25.00 | — | 1M | 閉源 |
| DeepSeek V4-Flash | 見官方表 | 見官方表 | — | 1M | 已開源 |
Qwen3.8-Max 輸出 $6/M 僅為 Kimi K3($15/M)的 40%、Fable 5($50/M)的 12%,對高頻 Agent 長輸出場景成本優勢明顯。國內定價:輸入 ¥12/M、輸出 ¥36/M、快取命中低至 ¥1.5/M。
05四種接入方式
方法一 — QwenCloud API: 透過阿里雲 Model Studio 取得 Key,相容 OpenAI 與 Anthropic 兩種介面協定,可直接替換 Claude Code、Codex 等工具的 base URL。
方法二 — 千問辦公: GA 同步上線的 Agent 產品,對標騰訊 WorkBuddy 與 Moonshot Kimi Work,適合知識工作者端到端任務。
from anthropic import Anthropic
client = Anthropic(
api_key="your_qwen_api_key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.messages.create(
model="qwen3.8-max",
max_tokens=8192,
messages=[{"role": "user", "content": "分析這段程式碼的效能瓶頸..."}],
extra_body={"reasoning": {"effort": "xhigh"}}
)
print(response.content[0].text)
方法三 — Qoder / QoderWork: 阿里自家 Agent IDE 與工作台,預覽期即已接入,GA 後定價恢復標準費率。
方法四 — 等下週開源權重: Qwen3.8-Max 完整版與 Qwen3.8-27B 精簡版計劃登陸 Hugging Face 與 ModelScope;完整版需多節點資料中心級硬體,27B 更適合本地 GPU 部署。
06橫向對比:怎麼選?
| 模型 | 廠商 | 總參數/激活 | 定價(輸入/輸出) | 權重 | 獨立第三方評測 |
|---|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 2.4T / 95B | $2 / $6 | 未開源(承諾中) | 暫無 |
| Kimi K3 | 月之暗面 | 2.8T / ~50B | $3 / $15 | 已開源(7/27) | AA Index ≈ 57.11 |
| DeepSeek V4-Pro | DeepSeek | 1.6T / 49B | 見官方表 | 已開源 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | DeepSeek | 同 V4-Pro | 見官方表 | 已開源 | 9 項 Agent 基準超 V4-Pro |
| Claude Fable 5 | Anthropic | 未公開 | $10 / $50 | 閉源 | Arena 文本 #1 |
| 場景 | 推薦模型 | 原因 |
|---|---|---|
| 成本敏感的高頻 Agent | Qwen3.8-Max | 輸出 $6/M,低於 K3 與 Fable 5 |
| 已開源權重自部署 | Kimi K3 | 2.8T 權重已上線 Hugging Face |
| 複雜 Repo 修 Bug / 深度推理 | Claude Fable 5 | SWE-bench Pro 80.0、HLE 53.3 領先 |
| 架構效率優先、不堆參數 | DeepSeek V4-Flash | 參數不變、Agent 基準大幅提升 |
| 多模態 + 1M 上下文 | Qwen3.8-Max | Arena 視覺 #2,原生視訊理解 |
| 國行 iPhone AI 生態 | 千問系列 | 見 Apple Intelligence 中國版 |
07開源承諾與爭議:標籤比權重早到
這是阿里首次承諾開源 Max 級旗艦權重,與 Kimi K3、DeepSeek 系列一起構成國產大模型「頭部廠商集體轉向開放權重」格局。但截至 8 月 4 日,信息披露時間差值得警惕:
- 官網已標「Open-Source」,Hugging Face / ModelScope 尚無對應倉庫。
- 所有跑分均來自阿里自建測試框架,Arena 1496 分標註 Preliminary。
- 預覽版階段禁止自動化生產呼叫,模型卡與安全評估缺失。
- Qwen 模型已透過 Apple Intelligence 中國版 進入數億部 iPhone 的系統級 AI 能力。
這不代表 Qwen3.8-Max 性能不行——獨立盲測顯示它確實與 Kimi K3 同檔位——但「躋身全球第一梯隊」的結論需等開源權重落地、第三方平台跑分上線後才能真正驗證。預計 8 月 10 日前後關注 Hugging Face 官方倉庫與開源協議條款。
08六步 Runbook:Qwen3.8-Max API 上手
-
01
註冊 QwenCloud API Key:在阿里雲 Model Studio 建立金鑰,存入金鑰管理器,勿提交到 Git。
-
02
選擇介面協定:已有 OpenAI 客戶端可直接替換 base URL;Claude Code 使用者選 Anthropic 相容端點並設定
reasoning.effort。 -
03
按任務選推理強度:簡單子任務用 low/medium 換 latency;複雜 Agent 長程任務用 xhigh(預設),避免不必要的 Token 消耗。
-
04
小規模冒煙測試:先用 1 萬 token 級任務驗證品質與延遲,再擴展到 1M 上下文整庫呼叫;對照 Kimi K3 做盲測 A/B。
-
05
接入 Agent Harness:指向 QwenCloud 相容端點,在 CI 中記錄 input/output token 與快取命中率;FrontierSWE 級修 Bug 保留給 Fable 5。
- 06
09總結與 FAQ
Qwen3.8-Max 代表阿里在 2026 年 AI 競賽中重新掌握敘事主動權的一次重要發布:Arena 文本前五、視覺第二、API 定價極具競爭力,並首次承諾 Max 級開源。但「Open-Source」標籤早於權重、基準均為自測、HLE 與 SWE-bench Pro 仍落後 Fable 5——工程團隊應以獨立盲測與自家 A/B 為準,而非僅看發布會數字。
團隊用 Qwen3.8-Max 驅動 Agent 對大型程式庫長時呼叫時,仍需要穩定、可稽核的本地開發與 CI 平面。共享分鐘池、桌下 Mac 或超賣 VPS 上的頻寬抖動、鄰居 CPU 搶佔與長連線中斷,會迅速吃掉 Token 降價帶來的收益。對更穩定的生產 Agent 主機與建置環境,NUKCLOUD 多區域裸機 Mac / 雲端 Mac 節點提供獨佔 Apple Silicon 算力與清晰租戶邊界,可在 定價頁 對照規格並經 下單頁 試跑。
資料截至 2026-08-04。來源:阿里雲官方博客、QwenCloud 定價頁、Arena.ai 公開排行榜(8 月 1 日快照)、獨立分析 Apidog / Yotta Labs / TechNode。基準為阿里巴巴自報數據。