Accueil / Blog / Kimi K3
ENGINEERING_BLOG · 2026.07.22

Kimi K3 Open Weights : date, benchmarks et déploiement local

KIMI K3 · Open Weights
27/072026

2,8T de paramètres sous Modified MIT — la plus vaste diffusion open weights jamais planifiée.

Le 27 juillet 2026 marque un tournant pour l'écosystème open weights : Moonshot AI publiera l'intégralité des poids de Kimi K3 — modèle MoE de 2,8 billions de paramètres avec fenêtre de 1 048 576 tokens — sous licence Modified MIT. Développeurs IA, responsables techniques et équipes créatives comparant kimi k3 open weights à Claude Fable 5 trouveront ici la chronologie complète, les spécifications, les benchmarks indépendants, la grille tarifaire API, la réalité matérielle du self-hosting et une checklist de release day. Verdict : K3 ne remplace pas Fable 5 (Intelligence Index 57,1, 3e/189), mais offre une capacité proche du frontier à environ un tiers du coût par tâche, plus un contexte 1M réellement exploitable sur votre propre infrastructure.

SECTION 01 Pourquoi Kimi K3 open weights prête à confusion même les ingénieurs ML

  • Deux dates, une seule architecture : API et apps Kimi dès le 16 juillet ; fichiers de poids le 27. Les intentions de recherche divergent — les mélanger nuit aux extraits enrichis.
  • Open weights n'est pas open source : checkpoints téléchargeables oui, code et données d'entraînement non. La précision terminologique compte pour la crédibilité technique.
  • Les titres « self-host » omettent l'essentiel : ~1,4 To en 4-bit, guidance officielle 64+ accélérateurs en super-nœud. Un portable ne suffit pas.
  • Sensibilité aux harnesses : Moonshot reconnaît une réactivité accrue quand le harness renvoie le contenu de raisonnement et une sur-réactivité sur l'intention ambiguë.
  • Les modèles fermés conservent l'avantage conversationnel : GDPval v2 Elo et DeepSWE favorisent Fable 5 et GPT-5.6 Sol ; K3 domine le coding soutenu et l'automation.

SECTION 02 Chronologie Kimi K3 et spécifications clés

Jalons Kimi K3
Date Événement
2026-07-16 Lancement API, Kimi App, Kimi Work, Kimi Code ; Artificial Analysis publie son évaluation indépendante le même jour
2026-07-17 Ouverture du WAIC Shanghai ; Xinhua présente K3 comme jalon national de l'IA
2026-07-27 Poids complets 2,8T sur Hugging Face (Modified MIT) + rapport technique
Spécifications Kimi K3
Élément Détail
Paramètres totaux 2,8 billions (2,8T) — plus grand modèle open weights à ce jour
Architecture MoE sparse — Stable LatentMoE ; 896 experts, 16 activés par token
Attention Kimi Delta Attention (KDA, hybride linéaire) + Attention Residuals (AttnRes) + Gated MLA
Fenêtre de contexte 1 048 576 tokens (~1M)
Modalités Vision native (texte + image) ; tier produit avec vidéo ; sortie texte
Format des poids Poids MXFP4 + activations MXFP8 (entraînement basse précision natif)
Efficacité de scaling ~2,5× vs K2 à compute égal (affirmation officielle)
Stabilité d'entraînement Quantile Balancing, optimiseur Per-Head Muon, activation SiTU
Décode long contexte KDA jusqu'à 6,3× accélération de décode à 1M tokens

K3 se positionne comme le premier modèle open weights ~3T — un défi aux primes closed source, pas une prétention à dominer chaque benchmark frontier.

SECTION 03 Benchmarks Kimi K3 face à Claude Fable 5 et GPT-5.6 Sol

Artificial Analysis Intelligence Index (run du 16 juillet 2026) :

Scores d'intelligence composite (Artificial Analysis, 16.07.2026)
Modèle Score Rang
Claude Fable 5 59,9 1
GPT-5.6 Sol 58,9 2
Kimi K3 57,1 3 / 189

Domaines où K3 gagne ou égalise : Frontend Code Arena #1 ; Automation Bench et SpreadsheetBench 2 #1 ; BrowseComp 91,2 (#1, jusqu'à 90,4+ en stratégie 1M sans compression) ; SWE Marathon 42,0 (GPT-5.5 et GLM-5.2 chutent en teens) ; Terminal Bench 2.1 88,3 (proche de Sol 88,8) ; Program Bench 77,8 (léger avantage sur Sol 77,6) ; FrontierSWE 81,2 (bien au-dessus de Sol 71,3, sous Fable 5 86,6).

Domaines où K3 reste en retrait : GDPval v2 Elo 1668–1687 vs Fable 5 1760 et Sol 1748 ; DeepSWE 67,5 vs Sol 73,0 ; taux d'hallucination en hausse vs K2.6 (reconnu officiellement) ; retours Reddit sur plus d'hallucinations que les top closed models ; polish dialogique et variance de session derrière Fable 5/Sol.

Pour l'architecture en profondeur, voir notre revue Kimi K3 open source ; pour un autre candidat open weights, l'analyse DeepSeek V4 GA.

SECTION 04 Tarification API Kimi K3 et coût réel avec cache

Tarifs API Kimi K3 (USD par 1M tokens)
Poste Prix
Entrée (cache miss) 3,00 $
Entrée (cache hit, automatique) 0,30 $
Sortie 15,00 $

Tarif le plus élevé parmi les LLM chinois, mais bien en dessous de Claude Opus 4.8 par tâche. Artificial Analysis mesure 0,94 $ par tâche pour K3 — 9,4 % sous GPT-5.6 Sol, 65,8 % sous Claude Fable 5. Les workloads de code dépasseraient 90 % de cache hit, abaissant la dépense effective sous le tarif catalogue.

SECTION 05 Kimi K3 est-il open source ? Open weights vs open source

Le 27 juillet, Moonshot publiera les poids 2,8T complets sur Hugging Face sous Modified MIT (termes exacts à confirmer le jour J) plus un rapport technique. Le support vLLM pour KDA et le prefix caching devrait arriver avec les poids ; quantifications Ollama/GGUF suivront le schéma K2.

Précision terminologique : K3 est une release open weights — checkpoints sous licence. Ce n'est pas de l'open source complet (code et jeux de données d'entraînement absents). Distinction essentielle pour la conformité et les requêtes is kimi k3 open source.

SECTION 06 Peut-on exécuter Kimi K3 localement ? Matériel et checklist

Réponse directe : pas sur du matériel grand public. Poids quantifiés 4-bit seuls : ~1,4 To. Guidance officielle : super-nœud 64+ accélérateurs, expert parallelism + tensor parallelism. Référence : K2.7 Code (1T) ~577 Go VRAM en INT4 — K3 est 2,8× plus grand.

Le self-hosting ne se justifie que pour : résidence des données stricte ou offline, fine-tuning sur données propriétaires, volume d'appels dépassant la facture API. Sinon, l'API à 3/15 $ par million de tokens est le choix par défaut.

  1. Surveiller l'org Hugging Face : suivre Moonshot AI avant le 27 juillet pour voir le dépôt dès publication.
  2. Vérifier LICENSE le jour J : lire le texte Modified MIT intégral — ne pas supposer un MIT standard.
  3. Contrôler shards et formats de quant : bundles MXFP4 et drops INT4/GGUF communautaires.
  4. Suivre les release notes vLLM : pinner un commit compatible KDA/prefix caching avant production.
  5. Documenter le hardware minimum du rapport technique : accélérateurs, interconnect, stratégie de parallélisme vs budget cluster.
  6. Rejouer les tests long contexte : valider les claims de décode 1M sur votre harness.
  7. Comparer TCO API vs self-host : énergie, réseau, ops, hypothèses de cache hit pour agents de code.

SECTION 07 Quatre implications industrielles de la release du 27 juillet

  • Écart open vs closed quasi comblé : spreads Intelligence Index de centaines de points à chiffres unitaires — la capacité seule ne justifie plus les primes closed.
  • Contexte géopolitique : K3 avant WAIC 2026 ; délisting temporaire US des modèles Anthropic Fable/Mythos (restauré le 1er juillet). Une fois publics, les poids ne se « délistent » pas.
  • Vague des vendors chinois : Z.ai GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 en est le sommet.
  • Retour de Moonshot : après DeepSeek R1 (2025, 7e domestiquement), la feuille de route K2 → K2.5 → K3 a reconstruit la crédibilité open weights.

SECTION 08 Données techniques citables et sources

  • Paramètres : 2,8T total ; 896 experts MoE, 16 actifs/token
  • Contexte : 1 048 576 tokens
  • Intelligence Index : K3 57,1 / Sol 58,9 / Fable 5 59,9 (AA, 16.07.2026)
  • Coût/tâche : K3 0,94 $ — 65,8 % sous Fable 5
  • API : 3 $ input miss / 0,30 $ cache hit / 15 $ output par M tokens
  • Stockage self-host : ~1,4 To en 4-bit ; 64+ accélérateurs recommandés
  • Licence : Modified MIT (texte complet le 27.07.)
  • Coding : Frontend Code Arena #1 ; SWE Marathon 42,0

Références officielles et indépendantes — revérifier les liens après mises à jour upstream :

Moonshot AI — blog technique Kimi K3

Kimi Platform — documentation API et tarifs

Artificial Analysis — Intelligence Index (16.07.2026)

Les poids ouverts K3 transforment l'économie de l'IA proche du frontier, mais ne compilent pas de projets Xcode, ne signent pas de binaires iOS ni ne débuguent de shaders Metal — autant de tâches centrales pour les workflows créatifs Apple. Les stacks macOS virtualisés ajoutent risque EULA et overhead mesurable. Le pattern production éprouvé : API K3 (ou futur endpoint self-host) pour le raisonnement million-token et l'orchestration d'agents, plus nœuds physiques VPSNIX M4/M4 Pro pour les builds natifs Apple Silicon — hardware Apple 100 %, root complet, zéro taxe hyperviseur, facturation élastique. Consultez les tarifs et ancrez vos agents longue durée sur une infrastructure physique conforme plutôt que sur une seule courbe API.

SECTION 09 FAQ

Quand les poids Kimi K3 seront-ils publiés ?

Le 27 juillet 2026. API et apps Kimi dès le 16 juillet ; checkpoints téléchargeables et rapport technique le 27 sur Hugging Face sous Modified MIT.

Kimi K3 est-il vraiment open source ?

Release open weights — checkpoints sous licence. Pas de code ni datasets d'entraînement le 27 juillet. Utiliser « open weights » dans les titres, nuancer dans le corps.

Combien coûte Kimi K3 ?

API : 3 $/M entrée (miss), 0,30 $/M (hit), 15 $/M sortie. ~0,94 $ par tâche selon Artificial Analysis — 65,8 % sous Claude Fable 5.

Puis-je exécuter K3 sur un GPU grand public ?

Non. ~1,4 To en 4-bit, 64+ accélérateurs en super-nœud recommandés. Sans infrastructure datacenter, utilisez l'API.

K3 bat-il Fable 5 ou GPT-5.6 Sol ?

Index global : non — K3 57,1 vs 59,9/58,9. Gagne sur des benches coding/automation, bien moins cher par tâche. Choisir selon le workload.

Quelle licence pour Kimi K3 ?

Modified MIT — texte complet publié le 27.07. sur Hugging Face. Lire le fichier avant redistribution commerciale ou fine-tune.