Startseite / Blog / Kimi K3
ENGINEERING_BLOG · 2026.07.28

Kimi K3 Open Weights: 2,8 Billionen Parameter, 1M Kontext — 11 Tage bis zum vollen Release

KIMI K3 · GESAMTPARAMETER
2.8T

Erstes vollständig offengelegtes 3T-Modell weltweit — ~1,56 TB auf Hugging Face.

Kurzfassung: Am 27.07.2026 (~23:00 Uhr Peking) veröffentlichte Moonshot AI die vollständigen Kimi K3-Gewichte, den Tech Report sowie MoonEP, FlashKDA und AgentEnv. Das Modell: 2,8 Billionen Gesamtparameter (MoE, ~104 Mrd. aktiv), 1M Token Kontext, native Vision. Für ML-Engineer, Tech Leads und Compliance-Verantwortliche in DACH liefert dieser Artikel die harten Zahlen: 11-Tage-Timeline seit API-Launch (16.07.), KDA/AttnRes-Architektur, SWE-bench 93,4 %, zwei kommerzielle Lizenzschwellen, DSGVO-relevante API-Routing-Abwägungen und die 64-GPU-Self-Host-Realität. Fazit: K3 ist das leistungsstärkste Open-Weight-Modell, aber kein OSI-Open-Source — für die Mehrheit der Teams schlägt API/OpenRouter Self-Hosting bei 1,56 TB und 64 GPUs.

SECTION 01 Fünf Datenpunkte, die Release-Headlines verzerren

  • Open Weight ≠ Open Source: Moonshot nutzt durchgängig „open weight“. Gewichte und Tech Report ja — Trainingsdaten und vollständiger Code nein. OSI-konform ist das nicht.
  • Modified MIT entfällt: K3 führt eine Custom-Lizenz ein. MaaS-Jahresumsatz > 20 Mio. USD oder MAU > 100 Mio./Monatsumsatz > 20 Mio. USD lösen Zusatzpflichten aus.
  • Self-Hosting-Kosten: 896 Experts, 1,56 TB Gewichte, offiziell 64+ GPU Supernode. TCO übersteigt API-Kosten für >95 % der DACH-Unternehmen.
  • Preis pro Task: ~0,95 USD/Task (Artificial Analysis) — 60 % günstiger als Claude Fable 5 (~2,4 USD), aber teurer als GLM-5.2 (~0,47 USD). Die Modified-MIT-Prognose vom 22.07. ist obsolet.
  • Geopolitik: Die Distillationsvorwürfe (22.–23.07.) und die Antwort des chinesischen Handelsministeriums (28.07.) rahmen den Release als Signal, nicht nur als Tech-Event.

SECTION 02 Timeline: 11 Tage von API-Launch zu Open Weights

  • 16.07. (WAIC-Vorab): K3 live auf kimi.com, Kimi Work/Code und API — Gewichte noch geschlossen.
  • 17.07.: Branchenanalysen; Xinhua: „größtes Open-Weight-Modell weltweit“.
  • 22.–23.07.: US-CN-Distillationsstreit eskaliert.
  • 27.07. ~23:00: Vollständige Gewichte, Tech Report; MoonEP + AgentEnv open (FlashKDA bereits früher).
  • 28.07.: Handelsministerium antwortet; Medienberichte. Drei Tage später: Alibaba Qwen3.8-Max-Preview (24T).
Kimi K3 — Kernspezifikationen (Stand 27.07.2026)
Merkmal Wert
Gesamtparameter 2,8 Billionen (2,8T)
Aktive Parameter ~104 Mrd.
Architektur Mixture-of-Experts (MoE)
Expert-Konfiguration 896 Routing-Experts, 16 aktiv/Token (+ Shared Experts)
Attention Kimi Delta Attention (KDA) + Gated MLA
Kontextfenster 1.048.576 Token
Multimodal Native Vision (ViT-V2, 27 Layer)
Gewichtsformat MXFP4 + MXFP8 (QAT ab SFT)
Gewichtsgröße ~1,56 TB (Hugging Face)
Lizenz Custom License (open weight, nicht open source)

SECTION 03 Architektur-Innovationen und Open-Infra-Daten

K3 ersetzt drei Deep-Learning-Grundbausteine — Attention, Residual, Optimizer — statt nur Parameter zu stapeln.

  • KDA: Kanalweise Vergessensraten statt skalar; chunkwise DPLR für lineare Rekursion; abwechselnd mit Gated MLA — 1M Kontext bei reduziertem KV-Cache.
  • AttnRes: Input-abhängige selektive Aggregation vorheriger Layer; +25 % Trainingseffizienz, <2 % Overhead.
  • Per-Head Muon: Pro-Attention-Head-Optimierung — rein Training-intern.
  • Stable LatentMoE: 896→16 Routing (~1,8 % Dichte), Quantile Balancing + MoonEP mit theoretischer Obergrenze redundanter Experts pro Node.
Mitveröffentlichte Infra (27.07.2026)
Technologie Funktion Messbare Leistung
MoonEP MoE-Kommunikationsbibliothek Temporäre Expert-Replikation; gleichmäßige Token-Verteilung pro Node
FlashKDA CUTLASS-basierter KDA-Operator H20 Prefill 1,72–2,22× vs. flash-linear-attention-Baseline
AgentEnv Agent-Sandbox mit KVCache.ai (Firecracker) Checkpoint 133 ms, Recovery 49 ms, Memory-Oversubscription 6,5×
SWE-bench Verified — unabhängige Reproduktion (Vals AI, Juli 2026)
Modell Score Release
Claude Opus 5 97 % 2026-07-24
GPT-5.6 Sol 96,2 % 2026-07-09
Claude Fable 5 95 % 2026-06-09
Kimi K3 93,4 % 2026-07-16
Qwen3.7-Max 79,4 % 2026-05-19
DeepSeek-V4 76,2 % 2026-04-23

Artificial Analysis Intelligence Index (Max-Reasoning): Fable 5 = 60, GPT-5.6 Sol = 59, K3 ≈ 57 (weltweit #3, Open Weight #1), GLM-5.2 = 51. Frontend Code Arena (Arena.ai): K3 führt.

K3 maximiert Open-Weight-Fähigkeit, nicht Euro pro Task. Wer GLM-5.2-Kosten erwartet, bekommt Frontier-Nähe — mit Frontier-nahen API-Rechnungen.

SECTION 04 Sechs Schritte: API-Integration, Lizenz und DSGVO-Check

  1. Custom-Lizenz prüfen: MaaS-Umsatz > 20 Mio. USD/Jahr oder MAU > 100 Mio./Monatsumsatz > 20 Mio. USD — Legal muss die Schwellen verifizieren.
  2. DSGVO-Datenfluss dokumentieren: Moonshot-API (api.moonshot.ai) verarbeitet Prompts in China. Für personenbezogene oder geschäftskritische Daten: AVV prüfen, Pseudonymisierung, EU-Proxy über OpenRouter evaluieren oder On-Prem-Gateway — siehe OpenRouter-Leitfaden.
  3. API Key und Endpoint: Modell-ID kimi-k3, Base URL https://api.moonshot.ai/v1.
  4. OpenAI-SDK-Kompatibilität: Nur base_url und api_key tauschen; Chat Completions bleiben unverändert.
  5. Prompt Caching aktivieren: Mooncake-Architektur: >90 % Cache-Hit bei Coding-Workloads → effektiv ~0,30 USD/M Input statt 3,00 USD.
  6. Self-Host vs. API TCO: 64 GPU + 1,56 TB Storage + Strom + SRE vs. API-Spend. Ohne Supernode: API/OpenRouter.
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(response.choices[0].message.content)

SECTION 05 API-Preise, Kennzahlen und Primärquellen

Kimi K3 API — Preise pro Million Token
Token-Typ Preis (USD)
Input (Cache Hit) 0,30
Input (Cache Miss) 3,00
Output (inkl. Reasoning) 15,00
  • Gewichte: 1,56 TB auf HF; Trending #1 innerhalb 30 Minuten nach Upload.
  • Sparsity: 16/896 Experts aktiv — 1,8 % Dichte.
  • FlashKDA: 1,72–2,22× Prefill auf H20.
  • Task-Kosten: ~0,95 USD (AA) vs. Fable 5 ~2,4 USD (−60 %) vs. GLM-5.2 ~0,47 USD.
  • Wettbewerb: Qwen3.8-Max-Preview (24T) drei Tage später — „3T-Club“ eskaliert.

Primärquellen — nach Release erneut verifizieren:

Moonshot AI — Kimi K3 Tech Blog

Hugging Face moonshotai (K3-Gewichte)

GitHub moonshotai/FlashKDA

Artificial Analysis Intelligence Index

Produktionsmuster für DACH-Teams: K3-Inferenz über Moonshot-API oder OpenRouter (DSGVO-Dokumentation!), Agent-Orchestrierung und iOS-CI/CD auf VPSNIX M4/M4 Pro Physikknoten — 100 % Apple-Hardware, Root-Zugriff, kein Hypervisor-Overhead, flexible Tages-/Monatsabrechnung. Cloud-LLMs ersetzen keine Xcode-Signierung oder Metal-Debug auf virtualisiertem macOS. K3 braucht 64 GPUs; macOS-Agents brauchen native Silizium-Hardware. Preise prüfen.

SECTION 06 FAQ

Ist Kimi K3 ein Open-Source-Modell?

Nein im OSI-Sinn. Open Weight: Gewichte, Tech Report, Teile der Infra sind öffentlich; Trainingsdaten und vollständiger Code nicht.

Darf Kimi K3 kommerziell genutzt werden?

In den meisten Fällen ja. Bei MaaS-Umsatz > 20 Mio. USD/Jahr oder MAU > 100 Mio./Monatsumsatz > 20 Mio. USD gelten Zusatzbedingungen.

Wie viele GPUs für Self-Hosting?

Offiziell 64+ GPUs Supernode. Für die Mehrheit: API oder OpenRouter.

Wie stark ist K3 in Benchmarks?

Stärkstes Open-Weight-Modell, AA Index ~57 (weltweit #3). Teurer pro Task als GLM-5.2.

K3 vs. K2 — was ist neu?

~3× Parameter vs. K2.5, AttnRes, Per-Head Muon, 1M Kontext, Vision. Lizenz: neue MaaS-Schwellen.