Synthèse : la publication du 27 juillet est le plus grand drop de poids téléchargeables à ce jour — et un portail de licence. Le test du 17 juillet couvre l'architecture et le tarif $3/$15 ; la controverse distillation intersecte les clauses licence personnalisée. Ce guide détaille le bundle, open-weight vs open source, MoonEP/FlashKDA/AgentEnv, 64+ GPU, benchmarks Claude/GPT-5.6, comparaison DeepSeek V4, runbook en six étapes et FAQ.
00Ce qui a été publié le 27 juillet
Dix jours après le lancement API, Moonshot a livré poids intégraux, code d'inférence et outils d'évaluation. vLLM 0.6.x, SGLang 0.4.x et transformers 4.49+ annoncent un support jour J ; versions quantifiées MXFP4 et NVFP4 incluses.
| Asset | Contenu |
|---|---|
| Poids complets | MoE 2,8T (896 experts, 16 actifs), MXFP4/NVFP4 |
| MoonEP | Framework de parallélisme experts pour clusters 64+ GPU |
| FlashKDA | Kernel Flash KDA : décodage jusqu'à 6,3× à 1M tokens |
| AgentEnv | Harness SWE Marathon / BrowseComp |
| Licence | licence personnalisée (open-weight) |
01Open-weight ≠ open source
Les médias parlent d'« open source » ; les équipes juridiques doivent lire le licence personnalisée. Comparé au MIT DeepSeek V4 ou Llama community :
| Critère | Kimi K3 | OSS typique (DeepSeek V4 MIT) |
|---|---|---|
| Téléchargement poids | Oui | Oui |
| Données d'entraînement | Non publiées | Généralement non |
| MaaS > 20 M$/an | Licence séparée | MIT : libre |
| Distillation concurrents | Restreinte | MIT : permise |
| Redistribution fine-tunée | Conditionnelle | MIT : libre |
Startups et labos peuvent auto-héberger ; les gateways type OpenRouter ou MaaS > 20 M$ nécessitent un contrat Moonshot. L'entrée de K3 dans le classement OpenRouter juillet relie trafic et pratique licence.
02MoonEP, FlashKDA, AgentEnv
MoonEP distribue 896 experts sur multi-nœuds à 1,8 % de sparsité — cible SLA sur clusters 64–128 GPU.
FlashKDA : implémentation CUDA/Triton de Kimi Delta Attention, KV cache −75 %, décodage ×6,3 à 1M tokens.
AgentEnv : configs reproductibles pour benchmarks Moonshot (SWE Marathon 42,0, BrowseComp 91,2) — réponse aux critiques de harness hétérogènes.
痛点Coûts cachés après le drop
- Pas un label OSS : seuil 20 M$ et interdiction distillation échouent aux checklists enterprise standard.
- 64+ GPU = CapEx : cluster H100×64 peut coûter plus que tokens API — modéliser TCO en premier.
- Sortie 15 $/M : agents haute fréquence : cache-hit (0,30 $/M entrée) peut rester plus rentable via API.
- Distillation US-Chine : K3 « se présente comme Claude » + clauses licence prolongent revues cross-border.
- Reproduction harness : FrontierSWE/HLE par labs indépendants : encore des semaines malgré AgentEnv.
- Séduction 1M contexte : tarif plat encourage remplissage — sans cache, le volume de tokens domine la facture.
03Benchmarks vs Claude et GPT-5.6
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 | 59,0 |
| Program Bench | 77,8 | 76,8 | 77,6 | 71,9 |
| FrontierSWE | 81,2 | 86,6 | 71,3 | 66,7 |
| SWE Marathon | 42,0 | 35,0 | 39,0 | 40,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 |
| OmniDocBench | 91,1 | 89,8 | 85,8 | 87,9 |
| Intelligence Index v4.1 | 57,1 (#4) | 59,9 (#1) | 58,9 (#2) | — |
Les poids ne changent pas les scores, mais AgentEnv permet reproduction tierce. FrontierSWE/HLE restent territoire Fable 5.
04Tarifs API et TCO auto-hébergé
| Modèle | Entrée ($/M) | Sortie ($/M) | Entrée cache | Contexte |
|---|---|---|---|---|
| Kimi K3 API | 3,00 | 15,00 | 0,30 | 1M |
| Claude Sonnet 5 | 3,00 | 15,00 | — | 200K |
| GPT-5.6 Sol | 5,00 | 30,00 | — | 400K |
| DeepSeek V4 Pro | 1,74 | 3,48 | 0,145 | 128K |
| K3 auto-hébergé (64 H100) | énergie+ops | variable | — | 1M |
Cache Mooncake : 90 %+ hits en Kimi Code, entrée effective ~0,55 $/M. Auto-hébergement gagne sur souveraineté ; API sur élasticité.
05Distillation US-Chine et licence
Vers le 25 juillet, la Maison-Blanche a accusé Moonshot de « distillation industrielle de Claude » ; Ryan Greenblatt a montré K3 divulguant claude-opus-4-5-20250929. Poids publiés malgré tout ; licence personnalisée interdit distillation vers concurrents — aligné avec le framing US.
Enterprise : séparer provenance modèle et périmètre licence. Tech : rebench AgentEnv ; Legal : clause 20 M$ dans contrats.
06Runbook en six étapes
-
01
Revue licence : licence personnalisée au juridique — seuil 20 M$, distillation, redistribution dérivés.
-
02
Choix de voie : sans 64+ GPU, prioriser platform.kimi.ai ou OpenRouter
moonshotai/kimi-k3; archiver poids Hugging Face. -
03
Stack : vLLM/SGLang + MoonEP + FlashKDA versions fixées ; pilote MXFP4, prod NVFP4/full.
-
04
AgentEnv : sous-ensemble SWE Marathon sur vos repos — journaliser delta vs claims Moonshot.
-
05
Routing mixte : K3 coding/docs longs ; Fable 5 FrontierSWE ; GPT-5.6 Sol agents terminal. Logs LiteLLM.
-
06
TCO : host agent + API sur page Tarifs ; CI sur nœud stable avant bascule prod.
07Conclusion et FAQ
K3 le 27 juillet = record de poids + porte commerciale. MoonEP/FlashKDA/AgentEnv améliorent l'auto-hébergement, mais 64+ GPU et 20 M$ définissent les limites.
Les équipes agent ont besoin de plans CI stables — jitter VPS partagé annule les savings tokens. Les nœuds Mac bare metal / cloud Mac multirégionaux NUKCLOUD offrent Apple Silicon dédié pour host agent, runners et gateway MCP. Consultez Tarifs, trial via Commander.
Données au 28.07.2026. Sources : Moonshot, Hugging Face, Kimi API, Artificial Analysis v4.1, AgentEnv.