Accueil / Blog / Kimi K3
ENGINEERING_BLOG · 2026.07.28

Kimi K3 en open weights : 2,8 billions de paramètres, un million de tokens

KIMI K3 · PARAMÈTRES TOTAUX
2.8T

Premier modèle 3T entièrement publié — ~1,56 To de poids sur Hugging Face.

La soirée du 27 juillet 2026 marque un tournant pour l'écosystème open weight : Moonshot AI dévoile l'intégralité des poids de Kimi K3, son rapport technique, et ouvre simultanément MoonEP, FlashKDA et AgentEnv — l'infrastructure qui a permis d'entraîner un MoE de 2,8 billions de paramètres (~104 milliards actifs) avec fenêtre d'un million de tokens et compréhension visuelle native. Onze jours seulement séparent le lancement API (16 juillet) de cette publication intégrale. Cet article s'adresse aux développeurs, architectes ML et responsables conformité qui doivent trancher entre API, OpenRouter et auto-hébergement. Notre verdict : K3 fixe le plafond des modèles open weight, mais n'est pas open source au sens OSI ; pour la majorité des équipes, l'API Moonshot ou OpenRouter reste plus rationnelle qu'un cluster de 64 GPU.

SECTION 01 Cinq idées reçues à corriger avant d'adopter K3

  • Open weight n'est pas open source : Moonshot emploie systématiquement « open weight ». Poids, rapport et infra partielle oui ; corpus d'entraînement et code complet non. La définition OSI n'est pas remplie.
  • Fin du Modified MIT : K3 passe à une licence sur mesure. Deux seuils commerciaux : MaaS > 20 M$/an, ou MAU > 100 M/revenus mensuels > 20 M$.
  • L'auto-hébergement reste théorique : 896 experts, 1,56 To, recommandation officielle 64 GPU minimum. Peu d'organisations disposent de cette capacité.
  • Le rapport qualité-prix diverge : ~0,95 $/tâche (Artificial Analysis) — 60 % moins cher que Claude Fable 5, mais plus onéreux que GLM-5.2 (~0,47 $). La prospectus du 22 juillet sous Modified MIT est caduc.
  • Contexte géopolitique : La controverse de distillation (22–23 juillet) et la réponse du ministère du Commerce chinois (28 juillet) transforment ce release en signal politique autant que technique.

SECTION 02 Chronologie : onze jours entre API et poids complets

  • 16 juillet (veille WAIC 2026) : K3 accessible sur kimi.com, Kimi Work/Code et API — poids non publiés.
  • 17 juillet : Analyses sectorielles ; Xinhua qualifie K3 de « plus grand modèle open weight au monde ».
  • 22–23 juillet : Escalade du différend US-Chine sur la distillation de modèles.
  • 27 juillet ~23h : Poids intégraux, rapport technique ; MoonEP et AgentEnv ouverts (FlashKDA déjà public).
  • 28 juillet : Réponse officielle du Commerce ; couverture médias. Trois jours plus tard : Alibaba Qwen3.8-Max-Preview (24T).
Spécifications clés de Kimi K3
Attribut Valeur
Paramètres totaux 2,8 billions (2,8T)
Paramètres actifs ~104 milliards
Architecture Mixture-of-Experts (MoE)
Configuration experts 896 experts routés, 16 actifs/token (+ experts partagés)
Attention Kimi Delta Attention (KDA) + Gated MLA
Fenêtre de contexte 1 048 576 tokens
Multimodal Vision native (ViT-V2, 27 couches)
Format des poids MXFP4 + MXFP8 (QAT dès SFT)
Volume des poids ~1,56 To (Hugging Face)
Licence Licence custom (open weight, pas open source)

SECTION 03 Innovations architecturales et infra ouverte

Plutôt que d'empiler des paramètres, K3 repense attention, connexions résiduelles et optimiseur — le cœur de sa montée en SWE-bench et en Intelligence Index.

  • KDA : Portes d'oubli par canal au lieu de scalaires ; récurrence linéaire via chunkwise DPLR ; alternance avec Gated MLA pour tenir 1M tokens tout en compressant le KV Cache.
  • AttnRes : Agrégation sélective des sorties précédentes selon l'entrée ; +25 % d'efficacité d'entraînement pour <2 % de surcoût.
  • Per-Head Muon : Optimisation indépendante par tête d'attention — invisible côté inférence API.
  • Stable LatentMoE : Routage 896→16 (~1,8 % de densité), Quantile Balancing et MoonEP avec borne théorique d'experts redondants par nœud.
Trois briques infra publiées le 27 juillet
Technologie Rôle Capacité clé
MoonEP Bibliothèque de communication MoE à granularité fine Réplication temporaire d'experts surchargés ; distribution uniforme des tokens
FlashKDA Opérateur KDA haute perf (CUTLASS) Prefill H20 ×1,72–2,22 vs baseline flash-linear-attention
AgentEnv Sandbox Agent avec KVCache.ai (Firecracker microVM) RL Agent parallèle ; checkpoint 133 ms, recovery 49 ms, surallocation mémoire 6,5×
SWE-bench Verified — reproduction indépendante (Vals AI, juillet 2026)
Modèle Score Date
Claude Opus 5 97 % 2026-07-24
GPT-5.6 Sol 96,2 % 2026-07-09
Claude Fable 5 95 % 2026-06-09
Kimi K3 93,4 % 2026-07-16
Qwen3.7-Max 79,4 % 2026-05-19
DeepSeek-V4 76,2 % 2026-04-23

Intelligence Index Artificial Analysis (max reasoning) : Fable 5 = 60, GPT-5.6 Sol = 59, K3 ≈ 57 (3e mondial, 1er open weight), GLM-5.2 = 51. K3 domine le Frontend Code Arena sur Arena.ai.

K3 offre le plafond de capacité open weight, pas le meilleur euro par tâche. Choisissez-le pour la frontière technique ; GLM-5.2 pour le volume économique.

SECTION 04 Six étapes : intégration API et conformité licence

  1. Lire la licence custom : Vérifier si MaaS > 20 M$/an ou MAU > 100 M/revenus mensuels > 20 M$ vous concerne — impliquer le juridique.
  2. Obtenir une clé Moonshot : Modèle kimi-k3, endpoint https://api.moonshot.ai/v1.
  3. Client compatible OpenAI SDK : Remplacer base_url et api_key ; la logique Chat Completions reste inchangée.
  4. Activer le Prompt Caching : Architecture Mooncake — taux de hit >90 % sur workloads code ; coût effectif ~0,30 $/M en entrée.
  5. Évaluer OpenRouter : Fallback multi-modèles et facturation unifiée via le guide OpenRouter (7 fournisseurs K3).
  6. Arbitrer auto-hébergement : 64 GPU + 1,56 To + ops vs appels API. Sans supernœud, abandonner le self-host.
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(response.choices[0].message.content)

SECTION 05 Tarifs API, données citables et sources

Tarifs Kimi K3 API (par million de tokens)
Type Prix
Entrée (cache hit) 0,30 $
Entrée (cache miss) 3,00 $
Sortie (reasoning inclus) 15,00 $
  • Poids : 1,56 To sur HF ; trending #1 en 30 minutes.
  • Densité : 16 experts actifs sur 896 — ~1,8 %.
  • FlashKDA : Prefill H20 ×1,72–2,22.
  • Coût/tâche : ~0,95 $ vs Fable 5 ~2,4 $ (−60 %) vs GLM-5.2 ~0,47 $.
  • Concurrence : Qwen3.8-Max-Preview (24T) trois jours après — le « club 3T » s'élargit.

Sources primaires — à reverifier après publication :

Blog technique Kimi K3 — Moonshot AI

Hugging Face moonshotai (téléchargement K3)

GitHub moonshotai/FlashKDA

Artificial Analysis Intelligence Index

Le schéma productif que nous observons : inférence K3 via API Moonshot ou OpenRouter pour le million de tokens, orchestration Agent et pipeline iOS sur nœuds physiques VPSNIX M4/M4 Pro — matériel Apple 100 %, accès root complet, zéro taxe d'hyperviseur, facturation flexible. Un LLM cloud ne signe pas vos binaires iOS ni ne débogue Metal sur macOS virtualisé. K3 exige 64 GPU ; vos agents macOS exigent du silicium natif. Consultez nos tarifs.

SECTION 06 Questions fréquentes

Kimi K3 est-il un modèle open source ?

Strictement non. Open weight : poids, rapport technique et infra partielle publics ; données et code d'entraînement complets non. Définition OSI non remplie.

Usage commercial gratuit de K3 ?

Oui dans la plupart des cas. MaaS > 20 M$/an ou MAU > 100 M/revenus mensuels > 20 M$ : clauses supplémentaires.

Combien de GPU pour l'auto-hébergement ?

64 GPU minimum en supernœud. Pour la majorité : API ou OpenRouter.

K3 est-il vraiment performant ?

1er open weight, 3e mondial (~57 sur AA Index). Plus coûteux par tâche que GLM-5.2.

Différences K3 vs K2 ?

~3× paramètres vs K2.5, AttnRes, Per-Head Muon, 1M tokens, vision. Licence : seuils MaaS nouveaux.