Qwen3.8-Max: 2,4 трлн параметров и 5-е место в Arena — открыты ли веса на самом деле?

3 августа 2026 Alibaba перевела Qwen3.8-Max в GA: sparse MoE с 2,4 трлн параметров, 95B активных на инференсе, контекст 1 048 576 токенов. LMSYS Arena Text — предварительно #5 (1496), Vision — #2. API: $2/$6 за миллион токенов. Веса на Hugging Face отсутствуют; анонс open source на следующую неделю не снимает вопрос «GA без weights».

Тезис: Qwen3.8-Max завершает двухнедельную серию китайских флагманов после Kimi K3 (веса 27 июля, 2,8T) и DeepSeek V4-Flash (31 июля). Архитектура: sparse MoE, active 95B/2,4T, context 1M. Метрики: Arena Text 1496 (#5 prov.), Vision #2, API $2/$6, слепой тест Kimi 83 vs Qwen preview 80. Все публичные бенчмарки — vendor-run. Apple Intelligence в Китае использует Qwen как backend — другой SKU. Ниже: spec table, pain points, comparison matrix, 6-step runbook, FAQ.

00Архитектура и GA-спеки

Qwen3.8-Max — флагман Alibaba Cloud (текст + vision). Sparse Mixture-of-Experts: полный стек 2,4×10¹² параметров, на forward pass активируется ~9,5×10¹⁰ (95B). Контекстное окно — 2²⁰ токенов (1M). Параллельно выпущен Qwen Office Agent (beta): оркестрация spreadsheet/slide/mail workflow на том же inference backend.

ПараметрЗначениеПримечание
Total params2,4T−14,3% vs Kimi K3 (2,8T)
Active params95Bsparse MoE routing
Context length1 048 576flat pricing per token
API model idqwen3.8-maxDashScope compatible-mode
API pricing$2 in / $6 out per 1MK3: $3/$15
Arena Text Elo1496 (prov. rank 5)community votes
Arena Visionrank 2 (prov.)
Weights on HFnone (2026-08-03)«next week» pledge
Три технических факта: ① active/total ratio ≈ 3,96% (95B/2,4T) ② output cost 2,5× ниже Kimi K3 ($6 vs $15/M) ③ blind eval gap −3 pts (80 vs 83) при лучшем Arena Text prov. rank.

РискиGA без weights и vendor benchmarks

  • Weights gap: on-prem eval, fine-tune, air-gapped compliance — недоступны до HF drop. K3 weights live с 2026-07-27.
  • Harness heterogeneity: Alibaba/Moonshot/DeepSeek гоняют свои toolchain — cross-vendor numbers не apples-to-apples.
  • Arena prov. rank: 1496 при малой выборке; доверительный интервал не опубликован.
  • 1M context bill: $2/$6 — за unit token; Office Agent + full PDF dump → linear token growth dominates TCO.
  • Routing debt: три флагмана за 14 дней без metrics dashboard → ad-hoc model switching.
  • Apple Qwen ≠ 3.8-Max API: разные контракты, latency SLA, model revision.

01Comparison matrix

ModelParams (total/active)ContextAPI $/MWeightsSignal
Qwen3.8-Max2,4T / 95B1M2 / 6Arena #5 (1496)
Kimi K32,8T / 16-of-896 MoE1M3 / 15open 2026-07-27blind 83
DeepSeek V4-Flashsparse128Klow2026-07-31cost
Claude Fable 5closed200K3 / 15FrontierSWE

026-step production runbook

DashScope OpenAI-compatible endpoint
from openai import OpenAI

client = OpenAI(
    api_key="your_dashscope_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Summarize Q3 report; output risk table as markdown"}]
)
  1. 01
    Provision DashScope API key + monthly spend cap in Alibaba Cloud console.
  2. 02
    Smoke test on Qwen Chat — latency, token counts, task success vs Kimi K3 on identical prompts.
  3. 03
    Context budget engineering: chunk + summary cache even with 1M window; monitor input/output ratio.
  4. 04
    Hybrid routing policy: Office/zh → 3.8-Max; max OSS weights → K3; batch → V4-Flash.
  5. 05
    Observability: export tokens, P95 latency, success rate — treat Arena 1496 as secondary signal only.
  6. 06
    Watch HF release next week — license, quant formats (GPTQ/AWQ), vLLM support. Roll up TCO with NUKCLOUD pricing for agent host.

03NUKCLOUD Mac nodes — stable agent/CI plane

Qwen3.8-Max API + local MCP servers + Xcode builds на shared macOS VPS → SSH drops, neighbor CPU contention, build queue jitter. Экономия $6/M output съедается инфраструктурой быстрее, чем кажется.

NUKCLOUD bare-metal / cloud Mac nodes: dedicated Apple Silicon, tenant isolation, regional primary paths. Specs: tseny.html, trial: zakaz.html. После HF drop — local weight eval на том же хосте, см. DeepSeek V4 inference runbook.

  • Open weights на дату GA?
    Нет. Только API. «Next week» — unverified pledge.
  • Arena rank 5 — достаточно для prod?
    Prov. rank. Run internal A/B before traffic shift.
  • Kimi 83 vs Qwen 80 — кто wins?
    Один vendor blind test. Route by workload: cost/API vs max OSS vs vision.
  • Apple Intelligence China = 3.8-Max?
    Different Qwen SKU, different SLA.
  • Где крутить agent CI?
    NUKCLOUD dedicated Mac nodes > oversubscribed shared pools.
  • Vendor benchmarks trusted?
    No independent repro yet. Treat as directional; validate on your data.

Data as of 2026-08-04. Sources: Alibaba Qwen GA announcement, LMSYS Arena (provisional), DashScope price sheet.