Accueil / Blog / Kimi K3
ENGINEERING_BLOG · 2026.07.17

Kimi K3 : 2,8 billions de paramètres — record open source 2026

KIMI K3 · PARAMÈTRES TOTAUX
2.8T

Environ 75 % au-dessus de DeepSeek V4 Pro (1,6T) — plus grand modèle IA open source à ce jour.

Les équipes qui comparent les LLM open source en 2026 ou cherchent à coupler génération de code longue et développement Apple ont une nouvelle référence : Kimi K3, déployé discrètement par Moonshot AI le 16 juillet 2026. Cet article s'adresse aux développeurs et décideurs techniques : architecture MoE 2,8 billions, innovations KDA / AttnRes / Stable LatentMoE, benchmarks face à Claude Fable 5 et GPT-5.6 Sol, grille tarifaire et calendrier open source du 27 juillet. Conclusion immédiate : K3 rivalise avec les modèles fermés sur le code long, mais ne remplace ni la chaîne Xcode ni le débogage Metal — API cloud et nœud M4 natif se complètent.

SECTION 01 Trois pièges fréquents lors du choix d'un LLM pour le code

  • Fenêtre de contexte surévaluée : Beaucoup annoncent 200K+ tokens mais tronquent encore sur un dépôt entier. K3 offre 1 million de tokens au tarif standard — adapté à l'analyse repo-wide.
  • Scores de benchmark vs. usage réel : Un bon SWE court ne garantit pas des heures de coding continu. SWE Marathon simule la durée — K3 mène avec 42,0.
  • L'API ne remplace pas l'environnement de build : Aucun LLM cloud ne signe ni ne compile de façon fiable sur macOS virtualisé. Voir le comparatif location vs achat Mac mini M4 pour le volet infrastructure.
  • Promesse open source vs. déploiement : 2,8T paramètres impliquent 64+ accélérateurs en production ; avant le 27 juillet, seules l'API et kimi.com restent pragmatiques.

SECTION 02 Qu'est-ce que Kimi K3 — et pourquoi ce lancement compte

Le 16 juillet 2026, pas de keynote : une bannière dans la doc API, un billet technique et l'identifiant kimi-k3 immédiatement invocable.

Définition : Kimi K3 est le plus grand modèle IA open source — 2,8 billions (2,8T) de paramètres, ~75 % au-dessus de DeepSeek V4 Pro (1,6T), 2,7× le modèle open source de Xiaomi (1,02T). MoE sparse : 16 experts actifs sur 896 (1,8 % de sparsité) ; contexte 1M ; vision native. Poids complets sur Hugging Face le 27 juillet 2026.

Spécifications clés Kimi K3
Dimension Valeur
Paramètres totaux 2,8 billions (2,8T)
Architecture KDA + AttnRes + Stable LatentMoE
Experts actifs 16 / 896 (sparsité 1,8 %)
Fenêtre de contexte 1 048 576 tokens (1M)
Modalités d'entrée Texte, image, vidéo
Tarif API 3 $ / 15 $ par million de tokens (entrée/sortie)
Open source poids 27 juillet 2026

Contexte stratégique : Kimi a dominé la taille open source 9 mois sur 12 ; lancement à la veille de la WAIC 2026 ; ARR >300 M$ (juin 2026), valorisation 31,5 Md$ ; revenus API >70 %, croissance utilisateurs payants internationaux +400 %.

SECTION 03 Trois innovations : KDA, AttnRes et Stable LatentMoE

Kimi Delta Attention (KDA) — attention linéaire hybride 3:1 (trois couches linéaires, une full attention). Cache KV −75 % ; décodage 1M tokens jusqu'à +6,3× ; dépasse les baselines full attention en contexte court, long et en scaling RL.

Attention Residuals (AttnRes) — connexions résiduelles profondes avec récupération sélective de représentations des couches antérieures. Moonshot annonce ~25 % d'efficacité d'entraînement pour <2 % de compute supplémentaire.

Stable LatentMoE — avec 896 experts et 16 actifs : Quantile Balancing, Per-Head Muon, Sigmoid Tanh Unit (SiTU) et Gated MLA. Efficacité de scaling ~2,5× vs Kimi K2.

KDA ressemble à un index intelligent : la plupart du temps des recherches rapides, et des rappels précis quand le contexte l'exige — plutôt que de tout garder en mémoire vive.

SECTION 04 Benchmarks : Kimi K3 vs Claude Fable 5 vs GPT-5.6 Sol

Benchmarks clés Moonshot (16/07/2026)
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE 67,5 70,0 73,0 59,0
Program Bench 77,8 76,8 77,6 71,9
Terminal Bench 2.1 88,3 84,6 88,8 84,6
FrontierSWE 81,2 86,6 71,3 66,7
SWE Marathon 42,0 35,0 39,0 40,0
BrowseComp 91,2 88,0 90,4 84,3
OmniDocBench 91,1 89,8 85,8 87,9
GPQA-Diamond 93,5 92,6 94,1 91,0

Lecture : SWE Marathon mesure le code soutenu — K3 mène largement. Program Bench et OmniDocBench également en tête. Intelligence Index v4.1 (Artificial Analysis) : K3 à 57,1, 4e mondial derrière Claude Fable 5 (59,9) et GPT-5.6 Sol (58,9). Note : chiffres éditeur ; harness d'inférence distincts — reproduction tierce en cours.

SECTION 05 Grille tarifaire et six étapes pour brancher Kimi K3

Tarifs API comparés ($/M tokens)
Modèle Entrée Sortie Entrée cache hit Contexte
Kimi K3 3,00 $ 15,00 $ 0,30 $ 1M
Claude Sonnet 5 3,00 $ 15,00 $ 200K
Claude Opus 4.8 5,00 $ 25,00 $ 200K
GPT-5.5 5,00 $ 30,00 $ 400K
DeepSeek V4 Pro 1,74 $ 3,48 $ 0,145 $ 128K
Kimi K2.6 0,95 $ 4,00 $ 0,16 $ 256K

K3 aligné sur Claude Sonnet 5 (3 $/15 $) avec un contexte cinq fois plus large ; cache hit dès 0,30 $/M — souvent >90 % en coding. API Chine : ¥20/M entrée ; kimi.com gratuit pour tester.

  1. Essai sans code : ouvrir kimi.com, créer un compte (Google possible), K3 tourne en force d'inférence max par défaut.
  2. Clé API Moonshot : générer sur platform.kimi.ai, vérifier solde et limites.
  3. Client compatible OpenAI : base_url=https://api.moonshot.ai/v1, modèle kimi-k3.
  4. Valider le premier appel : prompt court, contrôler facturation tokens et latence.
  5. (Option) OpenRouter : ID moonshotai/kimi-k3, tarifs officiels sans majoration, contexte 1M conservé.
  6. Marquer le 27 juillet : surveiller le dépôt Hugging Face ; évaluer quantisation vLLM/SGLang et seuil self-hosting (64+ cartes).
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analyse ce code pour les goulots de performance..."}]
)

SECTION 06 Matrice scénarios, calendrier open source et données citables

Quel modèle selon le cas d'usage
Scénario Recommandation Raison
Sessions code longues Kimi K3 SWE Marathon leader, plus long contexte
Correctifs repo complexes Claude Fable 5 FrontierSWE nettement devant
Agents terminal / toolchain GPT-5.6 Sol Terminal Bench en tête
Documents longs / multimodal Kimi K3 OmniDocBench 1er
Budget serré DeepSeek V4 Pro Sortie 3,48 $/M
Self-hosting (après 27/07) Kimi K3 Poids open source les plus puissants

Données techniques citables :

  • Paramètres : 2,8T total, MoE 896 experts, 16 actifs (1,8 % sparsité)
  • KDA : cache KV −75 %, décodage 1M +6,3×
  • AttnRes : entraînement +25 %, compute extra <2 %
  • vs K2 : efficacité scaling +2,5×
  • Intelligence Index v4.1 : K3 = 57,1, 4e mondial
  • ARR / valorisation : >300 M$ ARR (juin 2026), 31,5 Md$ pre-money
  • Dates clés : WAIC 17–20/07 → 27/07 poids Hugging Face

Sources officielles et tierces — revérifier après mise à jour :

Moonshot AI — billet technique Kimi K3

Kimi API Platform — tarifs et quickstart

Artificial Analysis — Intelligence Index v4.1

K3 prouve qu'un modèle open source peut défier les flagship fermés — mais un LLM cloud ne compile pas Xcode, ne débogue pas Metal ni ne gère les certificats iOS. macOS virtualisé : risque EULA et 20–40 % de perte. Stack efficace : API K3 pour code long et documents, nœuds physiques VPSNIX M4/M4 Pro pour compilation native et agents 7×24 — hardware Apple d'origine, Root complet, zéro hyperviseur, location journalière. Tarifs sur la page pricing ; si vous suivez le contentieux hardware IA Apple/OpenAI, ancrez le compute dans un environnement physique conforme plutôt que dans une virtualisation incertaine.

SECTION 07 FAQ

Kimi K3 est-il gratuit ?

Oui — compte gratuit kimi.com avec K3 (inférence max uniquement pour l'instant). API : 3 $/15 $ par million de tokens.

Puis-je exécuter Kimi K3 en local ?

Non avant le 27 juillet. Ensuite, l'inférence production exige 64+ accélérateurs — hors portée laptop.

K3 ou DeepSeek V4 Pro ?

K3 : quasi 2× paramètres (2,8T vs 1,6T), 1M vs 128K contexte, benchmarks supérieurs. DeepSeek : sortie 3,48 $/M, bien moins cher.

1 million de tokens, utile en pratique ?

Oui pour analyse repo entière, documents juridiques/scientifiques longs et mémoire agent — K3 ne surcharge pas selon la longueur.