Kimi K3 open-weight complet : licence personnalisée, seuil 20 M$, 27 juillet 2026

Le 27 juillet 2026, Moonshot AI a tenu sa promesse : les poids complets de Kimi K3 sont sur Hugging Face — 2,8 trillions de paramètres MoE, 1 million de tokens de contexte, stack MoonEP / FlashKDA / AgentEnv. La licence est open-weight, pas open source : les fournisseurs MaaS au-delà de 20 M$ de revenus annuels doivent négocier une accord commercial.

Synthèse : la publication du 27 juillet est le plus grand drop de poids téléchargeables à ce jour — et un portail de licence. Le test du 17 juillet couvre l'architecture et le tarif $3/$15 ; la controverse distillation intersecte les clauses licence personnalisée. Ce guide détaille le bundle, open-weight vs open source, MoonEP/FlashKDA/AgentEnv, 64+ GPU, benchmarks Claude/GPT-5.6, comparaison DeepSeek V4, runbook en six étapes et FAQ.

00Ce qui a été publié le 27 juillet

Dix jours après le lancement API, Moonshot a livré poids intégraux, code d'inférence et outils d'évaluation. vLLM 0.6.x, SGLang 0.4.x et transformers 4.49+ annoncent un support jour J ; versions quantifiées MXFP4 et NVFP4 incluses.

AssetContenu
Poids completsMoE 2,8T (896 experts, 16 actifs), MXFP4/NVFP4
MoonEPFramework de parallélisme experts pour clusters 64+ GPU
FlashKDAKernel Flash KDA : décodage jusqu'à 6,3× à 1M tokens
AgentEnvHarness SWE Marathon / BrowseComp
Licencelicence personnalisée (open-weight)
Trois données clés :2,8T poids (+75 % vs record open-weight précédent) ; ② 64+ GPU recommandation production ; ③ seuil MaaS 20 M$ annuels pour API commerciale.

01Open-weight ≠ open source

Les médias parlent d'« open source » ; les équipes juridiques doivent lire le licence personnalisée. Comparé au MIT DeepSeek V4 ou Llama community :

CritèreKimi K3OSS typique (DeepSeek V4 MIT)
Téléchargement poidsOuiOui
Données d'entraînementNon publiéesGénéralement non
MaaS > 20 M$/anLicence séparéeMIT : libre
Distillation concurrentsRestreinteMIT : permise
Redistribution fine-tunéeConditionnelleMIT : libre

Startups et labos peuvent auto-héberger ; les gateways type OpenRouter ou MaaS > 20 M$ nécessitent un contrat Moonshot. L'entrée de K3 dans le classement OpenRouter juillet relie trafic et pratique licence.

02MoonEP, FlashKDA, AgentEnv

MoonEP distribue 896 experts sur multi-nœuds à 1,8 % de sparsité — cible SLA sur clusters 64–128 GPU.

FlashKDA : implémentation CUDA/Triton de Kimi Delta Attention, KV cache −75 %, décodage ×6,3 à 1M tokens.

AgentEnv : configs reproductibles pour benchmarks Moonshot (SWE Marathon 42,0, BrowseComp 91,2) — réponse aux critiques de harness hétérogènes.

Réalité stack : nœud 8 GPU = démo quantifiée. Production : H100/H200 64+ avec MoonEP+FlashKDA, ou API Moonshot/OpenRouter.

痛点Coûts cachés après le drop

  • Pas un label OSS : seuil 20 M$ et interdiction distillation échouent aux checklists enterprise standard.
  • 64+ GPU = CapEx : cluster H100×64 peut coûter plus que tokens API — modéliser TCO en premier.
  • Sortie 15 $/M : agents haute fréquence : cache-hit (0,30 $/M entrée) peut rester plus rentable via API.
  • Distillation US-Chine : K3 « se présente comme Claude » + clauses licence prolongent revues cross-border.
  • Reproduction harness : FrontierSWE/HLE par labs indépendants : encore des semaines malgré AgentEnv.
  • Séduction 1M contexte : tarif plat encourage remplissage — sans cache, le volume de tokens domine la facture.

03Benchmarks vs Claude et GPT-5.6

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8
DeepSWE67,570,073,059,0
Program Bench77,876,877,671,9
FrontierSWE81,286,671,366,7
SWE Marathon42,035,039,040,0
BrowseComp91,288,090,484,3
OmniDocBench91,189,885,887,9
Intelligence Index v4.157,1 (#4)59,9 (#1)58,9 (#2)

Les poids ne changent pas les scores, mais AgentEnv permet reproduction tierce. FrontierSWE/HLE restent territoire Fable 5.

Écart : K3 mène en coding long et documents ; index global à 2,8 points de Fable 5 et GPT-5.6 Sol.

04Tarifs API et TCO auto-hébergé

ModèleEntrée ($/M)Sortie ($/M)Entrée cacheContexte
Kimi K3 API3,0015,000,301M
Claude Sonnet 53,0015,00200K
GPT-5.6 Sol5,0030,00400K
DeepSeek V4 Pro1,743,480,145128K
K3 auto-hébergé (64 H100)énergie+opsvariable1M

Cache Mooncake : 90 %+ hits en Kimi Code, entrée effective ~0,55 $/M. Auto-hébergement gagne sur souveraineté ; API sur élasticité.

05Distillation US-Chine et licence

Vers le 25 juillet, la Maison-Blanche a accusé Moonshot de « distillation industrielle de Claude » ; Ryan Greenblatt a montré K3 divulguant claude-opus-4-5-20250929. Poids publiés malgré tout ; licence personnalisée interdit distillation vers concurrents — aligné avec le framing US.

Enterprise : séparer provenance modèle et périmètre licence. Tech : rebench AgentEnv ; Legal : clause 20 M$ dans contrats.

06Runbook en six étapes

  1. 01
    Revue licence : licence personnalisée au juridique — seuil 20 M$, distillation, redistribution dérivés.
  2. 02
    Choix de voie : sans 64+ GPU, prioriser platform.kimi.ai ou OpenRouter moonshotai/kimi-k3 ; archiver poids Hugging Face.
  3. 03
    Stack : vLLM/SGLang + MoonEP + FlashKDA versions fixées ; pilote MXFP4, prod NVFP4/full.
  4. 04
    AgentEnv : sous-ensemble SWE Marathon sur vos repos — journaliser delta vs claims Moonshot.
  5. 05
    Routing mixte : K3 coding/docs longs ; Fable 5 FrontierSWE ; GPT-5.6 Sol agents terminal. Logs LiteLLM.
  6. 06
    TCO : host agent + API sur page Tarifs ; CI sur nœud stable avant bascule prod.

07Conclusion et FAQ

K3 le 27 juillet = record de poids + porte commerciale. MoonEP/FlashKDA/AgentEnv améliorent l'auto-hébergement, mais 64+ GPU et 20 M$ définissent les limites.

Les équipes agent ont besoin de plans CI stables — jitter VPS partagé annule les savings tokens. Les nœuds Mac bare metal / cloud Mac multirégionaux NUKCLOUD offrent Apple Silicon dédié pour host agent, runners et gateway MCP. Consultez Tarifs, trial via Commander.

Open source ?
Open-weight. licence personnalisée : seuil 20 M$, interdictions distillation.
Besoin GPU ?
64+ accélélateurs production. Mac portable inadapté.
MoonEP / FlashKDA / AgentEnv ?
Parallélisme MoE, inférence KDA flash, harness agent — release 27 juillet.
Prix API ?
Inchangés : 3/15 $/M, cache 0,30 $/M.
K3 vs DeepSeek V4 Pro ?
K3 : 2,8T, 1M, tops benchmarks. V4 Pro : 3,48 $/M sortie, MIT pur.
Controverse distillation ?
Poids en ligne ; politique et clauses continuent de filtrer l'adoption enterprise.

Données au 28.07.2026. Sources : Moonshot, Hugging Face, Kimi API, Artificial Analysis v4.1, AgentEnv.