Kimi K3 Full Open-Weight: Custom-Lizenz, $20M-Schwelle, 27. Juli 2026

Am 27. Juli 2026 lieferte Moonshot AI die versprochenen vollständigen Kimi-K3-Gewichte auf Hugging Face: 2,8 Trillionen Parameter MoE, 1M Token Kontext, Tooling MoonEP / FlashKDA / AgentEnv. Die Lizenz ist jedoch Open-Weight, nicht Open Source — kommerzielle MaaS-Anbieter mit über 20 Mio. USD Jahresumsatz benötigen eine separate Vereinbarung.

Kurzfassung: Der 27.-Juli-Release ist der größte downloadbare Gewichtsdrop der Geschichte — und gleichzeitig ein Lizenzgate. Review vom 17. Juli deckt Architektur und $3/$15; der Destillations-Streit kollidiert mit Modified-MIT-Klauseln. Daten: Gewichtspaket, Open-Weight vs. OSS, MoonEP/FlashKDA/AgentEnv, 64+ GPU, Benchmarks vs. Claude/GPT-5.6, DeepSeek V4-Vergleich, Sechs-Schritte-Runbook, FAQ.

00Release-Inhalt am 27. Juli

Moonshot veröffentlichte zehn Tage nach dem API-Launch Full Weights, Inferenzcode und Eval-Tools. vLLM 0.6.x, SGLang 0.4.x und transformers 4.49+ meldeten Day-Zero-Support; MXFP4- und NVFP4-Quantvarianten liegen parallel bereit.

AssetDetails
Full Weights2,8T MoE (896 Experten, 16 aktiv), MXFP4/NVFP4
MoonEPExperten-Parallelframework für 64+ GPU-Cluster
FlashKDAFlash-KDA-Kernel: bis 6,3× Decode bei 1M Kontext
AgentEnvHarness für SWE Marathon / BrowseComp
LizenzCustom-Lizenz (Open-Weight)
Drei harte Zahlen:2,8T Gewichte (+75 % vs. vorheriger Open-Weight-Rekord); ② 64+ GPU offizielle Produktionsempfehlung; ③ 20 Mio. USD jährlicher MaaS-Umsatz als kommerzielle Schwelle.

01Open-Weight ≠ Open Source

Presse nennt K3 „Open Source“; Legal muss Custom-Lizenz lesen. Im Vergleich zu DeepSeek V4 MIT oder Llama Community License gilt:

KriteriumKimi K3Typisches OSS (z. B. DeepSeek V4 MIT)
Gewicht-DownloadJaJa
TrainingsdatenNicht offenMeist nicht offen
MaaS > 20 Mio. USD/JahrSeparate LizenzMIT: frei
Destillation zu KonkurrenzmodellenEingeschränktMIT: erlaubt
Finetune-RedistributionBedingtMIT: frei

Startups und Forschung können intern hosten; OpenRouter-Skala-Gateways und MaaS-Anbieter über 20 Mio. USD brauchen Moonshot-Verträge. Der OpenRouter-Juli-Ranking-Einstieg von K3 verknüpft Traffic mit Lizenzpraxis.

02MoonEP, FlashKDA, AgentEnv

MoonEP verteilt 896 Experten über Multi-Node-Routing bei 1,8 % Aktivierungssparsamkeit. Ziel: SLA auf 64–128-GPU-Clustern.

FlashKDA implementiert Kimi Delta Attention in CUDA/Triton: KV-Cache −75 %, Decode bis 6,3× bei 1M Tokens.

AgentEnv liefert reproduzierbare Harness-Configs für Moonshot-eigene Benchmarks (SWE Marathon 42,0, BrowseComp 91,2) — Antwort auf Harness-Kritik.

Stack-Realität: 8-GPU-Knoten = Quant-Demo. Produktion: H100/H200 64+ mit MoonEP+FlashKDA oder Moonshot API/OpenRouter.

痛点Versteckte Kosten nach Gewichtsdrop

  • Kein „OSS“-Label: 20-Mio.-Schwelle und Destillationsverbote scheitern an Standard-Enterprise-OSS-Checklisten.
  • 64+ GPU = CapEx: H100-64-Cluster-Monatskosten können API-Token übersteigen — TCO zuerst.
  • 15 USD/M Ausgabe: Hochfrequenz-Agenten mit Cache-Hit (0,30 USD/M Eingabe) bleiben API-seitig oft günstiger.
  • Destillation + US-China: K3-„Claude“-Identifikation plus Lizenzklauseln verlängern Cross-Border-Reviews.
  • Harness-Reproduktion: FrontierSWE/HLE durch unabhängige Labs dauert Wochen trotz AgentEnv.
  • 1M-Kontext-Temptation: Flat Pricing fördert Vollnutzung — ohne Cache-Strategie dominiert Token-Volumen die Rechnung.

03Benchmarks vs. Claude und GPT-5.6

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8
DeepSWE67,570,073,059,0
Program Bench77,876,877,671,9
FrontierSWE81,286,671,366,7
SWE Marathon42,035,039,040,0
BrowseComp91,288,090,484,3
OmniDocBench91,189,885,887,9
Intelligence Index v4.157,1 (#4)59,9 (#1)58,9 (#2)

Gewichte ändern Scores nicht, aber AgentEnv ermöglicht Dritt-Reproduktion. FrontierSWE/HLE bleiben Fable-5-Terrain.

Gap: K3 führt bei Lang-Coding und Dokumenten; Gesamtindex innerhalb 2,8 Punkte von Fable 5 und GPT-5.6 Sol.

04API-Preise und Self-Host-TCO

ModellEingabe ($/M)Ausgabe ($/M)Cache-Hit EingabeKontext
Kimi K3 API3,0015,000,301M
Claude Sonnet 53,0015,00200K
GPT-5.6 Sol5,0030,00400K
DeepSeek V4 Pro1,743,480,145128K
K3 Self-Host (64 H100)Strom+Opsvariabel1M

Mooncake-Cache: 90 %+ Hit-Rate in Kimi Code, effektive Eingabe ~0,55 USD/M. Self-Host gewinnt bei Datenhoheit; API bei Elastizität.

05US-China-Destillation und Lizenz

Um den 25. Juli kritisierte das Weiße Haus Moonshots „industrielle Claude-Destillation“; Ryan Greenblatt zeigte K3-Leaks von claude-opus-4-5-20250929. Gewichte kamen trotzdem; Custom-Lizenz verbietet Destillation zu Konkurrenzmodellen — aligned mit US-Framing.

Enterprise: Modellherkunft und Lizenzumfang getrennt prüfen. Tech: AgentEnv-Rebench; Legal: 20-Mio.-Klausel in Verträge.

06Sechs-Schritte-Runbook

  1. 01
    Lizenz-Review: Custom-Lizenz an Legal — 20-Mio.-MaaS, Destillationsverbote, Derivat-Redistribution.
  2. 02
    Pfadwahl: Ohne 64+ GPU zuerst platform.kimi.ai oder OpenRouter moonshotai/kimi-k3; Gewichte von Hugging Face sichern.
  3. 03
    Stack: vLLM/SGLang + MoonEP + FlashKDA Version pinnen; MXFP4 Pilot, NVFP4/Full für Prod.
  4. 04
    AgentEnv: SWE-Marathon-Subset auf eigenen Repos — Delta zu Moonshot-Claims loggen.
  5. 05
    Routing: K3 für Lang-Coding/Docs; Fable 5 FrontierSWE; GPT-5.6 Sol Terminal-Agent. LiteLLM-Cost-Logs.
  6. 06
    TCO & Scale: Agent-Host + API auf Preisseite kalkulieren; CI auf stabilen Knoten vor Prod-Cutover.

07Fazit und FAQ

K3 am 27. Juli ist Rekord-Gewichtsdrop plus kommerzielles Gate. MoonEP/FlashKDA/AgentEnv erhöhen Self-Host-Praxis, aber 64+ GPU und 20 Mio. USD definieren die Grenzen.

Agent-Teams brauchen stabile CI-Ebenen — Shared-VPS-Jitter frisst Token-Savings. NUKCLOUD multiregionale Bare-Metal-Mac-/Cloud-Mac-Knoten liefern dediziertes Apple Silicon für Agent-Host, Runner und MCP-Gateway. Preisseite prüfen, Trial über Bestellseite.

Open Source?
Open-Weight. Custom-Lizenz: 20-Mio.-MaaS-Schwelle, Destillationsverbote.
GPU-Bedarf?
64+ Beschleuniger für Produktion. Mac/Laptop ungeeignet.
MoonEP / FlashKDA / AgentEnv?
MoE-Parallel, KDA-Flash-Inferenz, Agent-Benchmark-Harness — 27. Juli Release.
API-Preise?
Unverändert: 3/15 USD/M, Cache 0,30 USD/M.
K3 vs. DeepSeek V4 Pro?
K3: 2,8T, 1M, Benchmark-Spitzen. V4 Pro: 3,48 USD/M Ausgabe, purer MIT.
Destillations-Streit?
Gewichte live; Politik und Klauseln prüfen Enterprise-Adoption weiter.

Stand: 28.07.2026. Quellen: Moonshot, Hugging Face, Kimi API, Artificial Analysis v4.1, AgentEnv.