Qwen3.8-Max: 2,4 Billionen Parameter, Arena-Rang 5 – ist es wirklich Open Source?

Am 3. August 2026 ging Alibaba Qwen3.8-Max in GA: 2,4 Billionen Gesamtparameter, 95B aktiv, 1M Token Kontext, sparses MoE. LMSYS Arena Text: vorläufig Rang 5 (1496), Vision Rang 2. API: $2/$6 pro Million Tokens — 60 % günstiger als Kimi K3 Output. Gewichte: noch nicht veröffentlicht, trotz „Open-Source“-Marketing.

Kernzahlen: Qwen3.8-Max schließt eine zweiwöchige chinesische Modellserie ab — nach Kimi K3 (Gewichte 27. Juli, 2,8T) und DeepSeek V4-Flash (31. Juli). Datenpunkte: Arena Text 1496 (vorläufig #5), Vision #2, API $2/$6, Blindtest Kimi 83 vs. Qwen-Preview 80. Alle veröffentlichten Benchmarks sind vendor-run. Apple Intelligence China nutzt Qwen als Backend — separates SKU. Vergleichstabelle, Pain Points, Sechs-Schritte-Runbook und FAQ unten.

00Spezifikationen (GA 3. Aug. 2026)

MetrikWertBenchmark
Gesamtparameter2,4T−15 % vs. Kimi K3 (2,8T)
Aktive Parameter95BSparses MoE
Kontextfenster1.048.576= Kimi K3
Arena Text1496Vorläufig Rang 5
Arena VisionVorläufig Rang 2
API Input/Output$2 / $6K3: $3 / $15
GewichteNicht offen„Nächste Woche“ angekündigt
Blindtest (intern)80Kimi K3: 83
Drei harte Fakten: ① Output-Kosten 60 % unter Kimi K3 ($6 vs. $15/M). ② Arena Text 1496 — unabhängiger Community-Signal neben Vendor-Benchmarks. ③ GA ohne Hugging-Face-Dateien — Open-Source-Label ≠ Open Weights am Launch-Tag.

RisikoEntscheidungsfallen (datenbasiert)

  • Launch-Gap: 0 GB Gewichte am 3.8. — Compliance-Teams ohne API können nicht evaluieren. Kimi K3 hatte am 27.7. bereits Dateien.
  • Vendor-Benchmark-Bias: 100 % der zitierten Scores stammen aus Alibaba-/Moonshot-/DeepSeek-eigenen Harnesses — kein unabhängiger Repro-Stand 4.8.
  • Arena-Volatilität: 1496 Punkte bei geringer Stichprobe; Confidence Interval nicht veröffentlicht.
  • Token-Volumen > Stückpreis: $2/$6 lockt 1M-Kontext-Füllung; Office Agent + lange PDFs → Rechnung skaliert linear mit Tokens, nicht mit Modellpreis.
  • Routing-Debt: Drei Flaggschiffe in 14 Tagen — Teams ohne Metriken-Dashboard wechseln blind zwischen Modellen.

01Vergleichsmatrix

ModellParameterKontextAPI $/M (In/Out)GewichteSignal
Qwen3.8-Max2,4T / 95B1M2 / 6AngekündigtArena #5 (1496)
Kimi K32,8T1M3 / 15Offen seit 27.7.Blindtest 83
DeepSeek V4-Flash128KNiedrig31.7.Kosten
Claude Fable 5Closed200K3 / 15FrontierSWE

Qwen Office Agent (Beta am 3.8.) nutzt 3.8-Max für Tabellen-, Folien- und Mail-Workflows — relevant für APAC-Enterprise, weniger für reine Coding-Pipelines.

02Sechs-Schritte-Runbook (API)

DashScope — OpenAI-kompatibel
from openai import OpenAI

client = OpenAI(
    api_key="your_dashscope_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Quarterly report summary + risk table"}]
)
  1. 01
    API-Key + Budget-Alert: DashScope-Konsole, monatliches Cap setzen — Output $6/M bei Agent-Loops summiert schnell.
  2. 02
    Baseline messen: 10 repräsentative Tasks gegen Kimi K3 und DeepSeek V4 — Latenz, Tokens, Erfolgsrate.
  3. 03
    Kontext-Budget: Auch 1M Fenster — Chunking + Summary-Cache; Volumen dominiert Rechnung.
  4. 04
    Hybrid-Routing definieren: Office/CN → Qwen; max OSS → K3; Batch → V4-Flash.
  5. 05
    Dashboard: input/output Tokens, P95, Task-Success — Arena 1496 nur als Sekundärsignal.
  6. 06
    Gewichte-Woche: HF-Release prüfen (Lizenz, Quantisierung). Gesamtkosten mit NUKCLOUD-Preisen für Agent-Host addieren.

03Infrastruktur: NUKCLOUD Mac-Knoten

API-Ersparnis ($2/$6) verpufft, wenn Agent-Harness auf oversubscribed VPS läuft: SSH-Drops, Build-Jitter, Nachbar-CPU. Für 7×24 DashScope-Agenten + lokale MCP-Tools liefern NUKCLOUD Bare-Metal-Mac-Knoten dedizierte Apple-Silicon-Kapazität und klare Tenant-Grenzen.

Preise vergleichen, Bestellseite für Pilot-Knoten. Nach HF-Release: lokale Gewichts-Evaluierung auf demselben Host wie CI.

  • Open Source am Launch-Tag?
    Nein — nur API. Gewichte „nächste Woche“ — noch nicht verifizierbar.
  • 1496 Arena-Punkte — kaufen?
    Vorläufig. Eigene A/B-Daten priorisieren.
  • Kimi 83 vs. Qwen 80 — Ende der Diskussion?
    Ein Blindtest, vendor-run. GA kann abweichen; beide Modelle parallel fahren.
  • Apple Intelligence China = 3.8-Max?
    Nein — anderes Qwen-SKU, andere SLA.
  • Wo Agent-CI hosten?
    NUKCLOUD dedizierte Mac-Knoten — stabiler als Shared macOS-Cloud.

Stand: 2026-08-04. Quellen: Alibaba Qwen GA, LMSYS Arena (vorläufig), DashScope-Preisliste, Moonshot-Blindtest-Berichte.