Kurzfassung: Der 27.-Juli-Release ist der größte downloadbare Gewichtsdrop der Geschichte — und gleichzeitig ein Lizenzgate. Review vom 17. Juli deckt Architektur und $3/$15; der Destillations-Streit kollidiert mit Modified-MIT-Klauseln. Daten: Gewichtspaket, Open-Weight vs. OSS, MoonEP/FlashKDA/AgentEnv, 64+ GPU, Benchmarks vs. Claude/GPT-5.6, DeepSeek V4-Vergleich, Sechs-Schritte-Runbook, FAQ.
00Release-Inhalt am 27. Juli
Moonshot veröffentlichte zehn Tage nach dem API-Launch Full Weights, Inferenzcode und Eval-Tools. vLLM 0.6.x, SGLang 0.4.x und transformers 4.49+ meldeten Day-Zero-Support; MXFP4- und NVFP4-Quantvarianten liegen parallel bereit.
| Asset | Details |
|---|---|
| Full Weights | 2,8T MoE (896 Experten, 16 aktiv), MXFP4/NVFP4 |
| MoonEP | Experten-Parallelframework für 64+ GPU-Cluster |
| FlashKDA | Flash-KDA-Kernel: bis 6,3× Decode bei 1M Kontext |
| AgentEnv | Harness für SWE Marathon / BrowseComp |
| Lizenz | Custom-Lizenz (Open-Weight) |
01Open-Weight ≠ Open Source
Presse nennt K3 „Open Source“; Legal muss Custom-Lizenz lesen. Im Vergleich zu DeepSeek V4 MIT oder Llama Community License gilt:
| Kriterium | Kimi K3 | Typisches OSS (z. B. DeepSeek V4 MIT) |
|---|---|---|
| Gewicht-Download | Ja | Ja |
| Trainingsdaten | Nicht offen | Meist nicht offen |
| MaaS > 20 Mio. USD/Jahr | Separate Lizenz | MIT: frei |
| Destillation zu Konkurrenzmodellen | Eingeschränkt | MIT: erlaubt |
| Finetune-Redistribution | Bedingt | MIT: frei |
Startups und Forschung können intern hosten; OpenRouter-Skala-Gateways und MaaS-Anbieter über 20 Mio. USD brauchen Moonshot-Verträge. Der OpenRouter-Juli-Ranking-Einstieg von K3 verknüpft Traffic mit Lizenzpraxis.
02MoonEP, FlashKDA, AgentEnv
MoonEP verteilt 896 Experten über Multi-Node-Routing bei 1,8 % Aktivierungssparsamkeit. Ziel: SLA auf 64–128-GPU-Clustern.
FlashKDA implementiert Kimi Delta Attention in CUDA/Triton: KV-Cache −75 %, Decode bis 6,3× bei 1M Tokens.
AgentEnv liefert reproduzierbare Harness-Configs für Moonshot-eigene Benchmarks (SWE Marathon 42,0, BrowseComp 91,2) — Antwort auf Harness-Kritik.
痛点Versteckte Kosten nach Gewichtsdrop
- Kein „OSS“-Label: 20-Mio.-Schwelle und Destillationsverbote scheitern an Standard-Enterprise-OSS-Checklisten.
- 64+ GPU = CapEx: H100-64-Cluster-Monatskosten können API-Token übersteigen — TCO zuerst.
- 15 USD/M Ausgabe: Hochfrequenz-Agenten mit Cache-Hit (0,30 USD/M Eingabe) bleiben API-seitig oft günstiger.
- Destillation + US-China: K3-„Claude“-Identifikation plus Lizenzklauseln verlängern Cross-Border-Reviews.
- Harness-Reproduktion: FrontierSWE/HLE durch unabhängige Labs dauert Wochen trotz AgentEnv.
- 1M-Kontext-Temptation: Flat Pricing fördert Vollnutzung — ohne Cache-Strategie dominiert Token-Volumen die Rechnung.
03Benchmarks vs. Claude und GPT-5.6
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 | 59,0 |
| Program Bench | 77,8 | 76,8 | 77,6 | 71,9 |
| FrontierSWE | 81,2 | 86,6 | 71,3 | 66,7 |
| SWE Marathon | 42,0 | 35,0 | 39,0 | 40,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 |
| OmniDocBench | 91,1 | 89,8 | 85,8 | 87,9 |
| Intelligence Index v4.1 | 57,1 (#4) | 59,9 (#1) | 58,9 (#2) | — |
Gewichte ändern Scores nicht, aber AgentEnv ermöglicht Dritt-Reproduktion. FrontierSWE/HLE bleiben Fable-5-Terrain.
04API-Preise und Self-Host-TCO
| Modell | Eingabe ($/M) | Ausgabe ($/M) | Cache-Hit Eingabe | Kontext |
|---|---|---|---|---|
| Kimi K3 API | 3,00 | 15,00 | 0,30 | 1M |
| Claude Sonnet 5 | 3,00 | 15,00 | — | 200K |
| GPT-5.6 Sol | 5,00 | 30,00 | — | 400K |
| DeepSeek V4 Pro | 1,74 | 3,48 | 0,145 | 128K |
| K3 Self-Host (64 H100) | Strom+Ops | variabel | — | 1M |
Mooncake-Cache: 90 %+ Hit-Rate in Kimi Code, effektive Eingabe ~0,55 USD/M. Self-Host gewinnt bei Datenhoheit; API bei Elastizität.
05US-China-Destillation und Lizenz
Um den 25. Juli kritisierte das Weiße Haus Moonshots „industrielle Claude-Destillation“; Ryan Greenblatt zeigte K3-Leaks von claude-opus-4-5-20250929. Gewichte kamen trotzdem; Custom-Lizenz verbietet Destillation zu Konkurrenzmodellen — aligned mit US-Framing.
Enterprise: Modellherkunft und Lizenzumfang getrennt prüfen. Tech: AgentEnv-Rebench; Legal: 20-Mio.-Klausel in Verträge.
06Sechs-Schritte-Runbook
-
01
Lizenz-Review: Custom-Lizenz an Legal — 20-Mio.-MaaS, Destillationsverbote, Derivat-Redistribution.
-
02
Pfadwahl: Ohne 64+ GPU zuerst platform.kimi.ai oder OpenRouter
moonshotai/kimi-k3; Gewichte von Hugging Face sichern. -
03
Stack: vLLM/SGLang + MoonEP + FlashKDA Version pinnen; MXFP4 Pilot, NVFP4/Full für Prod.
-
04
AgentEnv: SWE-Marathon-Subset auf eigenen Repos — Delta zu Moonshot-Claims loggen.
-
05
Routing: K3 für Lang-Coding/Docs; Fable 5 FrontierSWE; GPT-5.6 Sol Terminal-Agent. LiteLLM-Cost-Logs.
-
06
TCO & Scale: Agent-Host + API auf Preisseite kalkulieren; CI auf stabilen Knoten vor Prod-Cutover.
07Fazit und FAQ
K3 am 27. Juli ist Rekord-Gewichtsdrop plus kommerzielles Gate. MoonEP/FlashKDA/AgentEnv erhöhen Self-Host-Praxis, aber 64+ GPU und 20 Mio. USD definieren die Grenzen.
Agent-Teams brauchen stabile CI-Ebenen — Shared-VPS-Jitter frisst Token-Savings. NUKCLOUD multiregionale Bare-Metal-Mac-/Cloud-Mac-Knoten liefern dediziertes Apple Silicon für Agent-Host, Runner und MCP-Gateway. Preisseite prüfen, Trial über Bestellseite.
Stand: 28.07.2026. Quellen: Moonshot, Hugging Face, Kimi API, Artificial Analysis v4.1, AgentEnv.