Тезис: Qwen3.8-Max завершает двухнедельную серию китайских флагманов после Kimi K3 (веса 27 июля, 2,8T) и DeepSeek V4-Flash (31 июля). Архитектура: sparse MoE, active 95B/2,4T, context 1M. Метрики: Arena Text 1496 (#5 prov.), Vision #2, API $2/$6, слепой тест Kimi 83 vs Qwen preview 80. Все публичные бенчмарки — vendor-run. Apple Intelligence в Китае использует Qwen как backend — другой SKU. Ниже: spec table, pain points, comparison matrix, 6-step runbook, FAQ.
00Архитектура и GA-спеки
Qwen3.8-Max — флагман Alibaba Cloud (текст + vision). Sparse Mixture-of-Experts: полный стек 2,4×10¹² параметров, на forward pass активируется ~9,5×10¹⁰ (95B). Контекстное окно — 2²⁰ токенов (1M). Параллельно выпущен Qwen Office Agent (beta): оркестрация spreadsheet/slide/mail workflow на том же inference backend.
| Параметр | Значение | Примечание |
|---|---|---|
| Total params | 2,4T | −14,3% vs Kimi K3 (2,8T) |
| Active params | 95B | sparse MoE routing |
| Context length | 1 048 576 | flat pricing per token |
| API model id | qwen3.8-max | DashScope compatible-mode |
| API pricing | $2 in / $6 out per 1M | K3: $3/$15 |
| Arena Text Elo | 1496 (prov. rank 5) | community votes |
| Arena Vision | rank 2 (prov.) | — |
| Weights on HF | none (2026-08-03) | «next week» pledge |
РискиGA без weights и vendor benchmarks
- Weights gap: on-prem eval, fine-tune, air-gapped compliance — недоступны до HF drop. K3 weights live с 2026-07-27.
- Harness heterogeneity: Alibaba/Moonshot/DeepSeek гоняют свои toolchain — cross-vendor numbers не apples-to-apples.
- Arena prov. rank: 1496 при малой выборке; доверительный интервал не опубликован.
- 1M context bill: $2/$6 — за unit token; Office Agent + full PDF dump → linear token growth dominates TCO.
- Routing debt: три флагмана за 14 дней без metrics dashboard → ad-hoc model switching.
- Apple Qwen ≠ 3.8-Max API: разные контракты, latency SLA, model revision.
01Comparison matrix
| Model | Params (total/active) | Context | API $/M | Weights | Signal |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 1M | 2 / 6 | Arena #5 (1496) | |
| Kimi K3 | 2,8T / 16-of-896 MoE | 1M | 3 / 15 | open 2026-07-27 | blind 83 |
| DeepSeek V4-Flash | sparse | 128K | low | 2026-07-31 | cost |
| Claude Fable 5 | closed | 200K | 3 / 15 | — | FrontierSWE |
026-step production runbook
from openai import OpenAI
client = OpenAI(
api_key="your_dashscope_api_key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Summarize Q3 report; output risk table as markdown"}]
)
-
01
Provision DashScope API key + monthly spend cap in Alibaba Cloud console.
-
02
Smoke test on Qwen Chat — latency, token counts, task success vs Kimi K3 on identical prompts.
-
03
Context budget engineering: chunk + summary cache even with 1M window; monitor input/output ratio.
-
04
Hybrid routing policy: Office/zh → 3.8-Max; max OSS weights → K3; batch → V4-Flash.
-
05
Observability: export tokens, P95 latency, success rate — treat Arena 1496 as secondary signal only.
-
06
Watch HF release next week — license, quant formats (GPTQ/AWQ), vLLM support. Roll up TCO with NUKCLOUD pricing for agent host.
03NUKCLOUD Mac nodes — stable agent/CI plane
Qwen3.8-Max API + local MCP servers + Xcode builds на shared macOS VPS → SSH drops, neighbor CPU contention, build queue jitter. Экономия $6/M output съедается инфраструктурой быстрее, чем кажется.
NUKCLOUD bare-metal / cloud Mac nodes: dedicated Apple Silicon, tenant isolation, regional primary paths. Specs: tseny.html, trial: zakaz.html. После HF drop — local weight eval на том же хосте, см. DeepSeek V4 inference runbook.
-
Open weights на дату GA?Нет. Только API. «Next week» — unverified pledge.
-
Arena rank 5 — достаточно для prod?Prov. rank. Run internal A/B before traffic shift.
-
Kimi 83 vs Qwen 80 — кто wins?Один vendor blind test. Route by workload: cost/API vs max OSS vs vision.
-
Apple Intelligence China = 3.8-Max?Different Qwen SKU, different SLA.
-
Где крутить agent CI?NUKCLOUD dedicated Mac nodes > oversubscribed shared pools.
-
Vendor benchmarks trusted?No independent repro yet. Treat as directional; validate on your data.
Data as of 2026-08-04. Sources: Alibaba Qwen GA announcement, LMSYS Arena (provisional), DashScope price sheet.