Kurzfassung: Am 27.07.2026 (~23:00 Uhr Peking) veröffentlichte Moonshot AI die vollständigen Kimi K3-Gewichte, den Tech Report sowie MoonEP, FlashKDA und AgentEnv. Das Modell: 2,8 Billionen Gesamtparameter (MoE, ~104 Mrd. aktiv), 1M Token Kontext, native Vision. Für ML-Engineer, Tech Leads und Compliance-Verantwortliche in DACH liefert dieser Artikel die harten Zahlen: 11-Tage-Timeline seit API-Launch (16.07.), KDA/AttnRes-Architektur, SWE-bench 93,4 %, zwei kommerzielle Lizenzschwellen, DSGVO-relevante API-Routing-Abwägungen und die 64-GPU-Self-Host-Realität. Fazit: K3 ist das leistungsstärkste Open-Weight-Modell, aber kein OSI-Open-Source — für die Mehrheit der Teams schlägt API/OpenRouter Self-Hosting bei 1,56 TB und 64 GPUs.
SECTION 01 Fünf Datenpunkte, die Release-Headlines verzerren
- Open Weight ≠ Open Source: Moonshot nutzt durchgängig „open weight“. Gewichte und Tech Report ja — Trainingsdaten und vollständiger Code nein. OSI-konform ist das nicht.
- Modified MIT entfällt: K3 führt eine Custom-Lizenz ein. MaaS-Jahresumsatz > 20 Mio. USD oder MAU > 100 Mio./Monatsumsatz > 20 Mio. USD lösen Zusatzpflichten aus.
- Self-Hosting-Kosten: 896 Experts, 1,56 TB Gewichte, offiziell 64+ GPU Supernode. TCO übersteigt API-Kosten für >95 % der DACH-Unternehmen.
- Preis pro Task: ~0,95 USD/Task (Artificial Analysis) — 60 % günstiger als Claude Fable 5 (~2,4 USD), aber teurer als GLM-5.2 (~0,47 USD). Die Modified-MIT-Prognose vom 22.07. ist obsolet.
- Geopolitik: Die Distillationsvorwürfe (22.–23.07.) und die Antwort des chinesischen Handelsministeriums (28.07.) rahmen den Release als Signal, nicht nur als Tech-Event.
SECTION 02 Timeline: 11 Tage von API-Launch zu Open Weights
- 16.07. (WAIC-Vorab): K3 live auf kimi.com, Kimi Work/Code und API — Gewichte noch geschlossen.
- 17.07.: Branchenanalysen; Xinhua: „größtes Open-Weight-Modell weltweit“.
- 22.–23.07.: US-CN-Distillationsstreit eskaliert.
- 27.07. ~23:00: Vollständige Gewichte, Tech Report; MoonEP + AgentEnv open (FlashKDA bereits früher).
- 28.07.: Handelsministerium antwortet; Medienberichte. Drei Tage später: Alibaba Qwen3.8-Max-Preview (24T).
| Merkmal | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen (2,8T) |
| Aktive Parameter | ~104 Mrd. |
| Architektur | Mixture-of-Experts (MoE) |
| Expert-Konfiguration | 896 Routing-Experts, 16 aktiv/Token (+ Shared Experts) |
| Attention | Kimi Delta Attention (KDA) + Gated MLA |
| Kontextfenster | 1.048.576 Token |
| Multimodal | Native Vision (ViT-V2, 27 Layer) |
| Gewichtsformat | MXFP4 + MXFP8 (QAT ab SFT) |
| Gewichtsgröße | ~1,56 TB (Hugging Face) |
| Lizenz | Custom License (open weight, nicht open source) |
SECTION 03 Architektur-Innovationen und Open-Infra-Daten
K3 ersetzt drei Deep-Learning-Grundbausteine — Attention, Residual, Optimizer — statt nur Parameter zu stapeln.
- KDA: Kanalweise Vergessensraten statt skalar; chunkwise DPLR für lineare Rekursion; abwechselnd mit Gated MLA — 1M Kontext bei reduziertem KV-Cache.
- AttnRes: Input-abhängige selektive Aggregation vorheriger Layer; +25 % Trainingseffizienz, <2 % Overhead.
- Per-Head Muon: Pro-Attention-Head-Optimierung — rein Training-intern.
- Stable LatentMoE: 896→16 Routing (~1,8 % Dichte), Quantile Balancing + MoonEP mit theoretischer Obergrenze redundanter Experts pro Node.
| Technologie | Funktion | Messbare Leistung |
|---|---|---|
| MoonEP | MoE-Kommunikationsbibliothek | Temporäre Expert-Replikation; gleichmäßige Token-Verteilung pro Node |
| FlashKDA | CUTLASS-basierter KDA-Operator | H20 Prefill 1,72–2,22× vs. flash-linear-attention-Baseline |
| AgentEnv | Agent-Sandbox mit KVCache.ai (Firecracker) | Checkpoint 133 ms, Recovery 49 ms, Memory-Oversubscription 6,5× |
| Modell | Score | Release |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
| DeepSeek-V4 | 76,2 % | 2026-04-23 |
Artificial Analysis Intelligence Index (Max-Reasoning): Fable 5 = 60, GPT-5.6 Sol = 59, K3 ≈ 57 (weltweit #3, Open Weight #1), GLM-5.2 = 51. Frontend Code Arena (Arena.ai): K3 führt.
K3 maximiert Open-Weight-Fähigkeit, nicht Euro pro Task. Wer GLM-5.2-Kosten erwartet, bekommt Frontier-Nähe — mit Frontier-nahen API-Rechnungen.
SECTION 04 Sechs Schritte: API-Integration, Lizenz und DSGVO-Check
- Custom-Lizenz prüfen: MaaS-Umsatz > 20 Mio. USD/Jahr oder MAU > 100 Mio./Monatsumsatz > 20 Mio. USD — Legal muss die Schwellen verifizieren.
- DSGVO-Datenfluss dokumentieren: Moonshot-API (
api.moonshot.ai) verarbeitet Prompts in China. Für personenbezogene oder geschäftskritische Daten: AVV prüfen, Pseudonymisierung, EU-Proxy über OpenRouter evaluieren oder On-Prem-Gateway — siehe OpenRouter-Leitfaden. - API Key und Endpoint: Modell-ID
kimi-k3, Base URLhttps://api.moonshot.ai/v1. - OpenAI-SDK-Kompatibilität: Nur
base_urlundapi_keytauschen; Chat Completions bleiben unverändert. - Prompt Caching aktivieren: Mooncake-Architektur: >90 % Cache-Hit bei Coding-Workloads → effektiv ~0,30 USD/M Input statt 3,00 USD.
- Self-Host vs. API TCO: 64 GPU + 1,56 TB Storage + Strom + SRE vs. API-Spend. Ohne Supernode: API/OpenRouter.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(response.choices[0].message.content)
SECTION 05 API-Preise, Kennzahlen und Primärquellen
| Token-Typ | Preis (USD) |
|---|---|
| Input (Cache Hit) | 0,30 |
| Input (Cache Miss) | 3,00 |
| Output (inkl. Reasoning) | 15,00 |
- Gewichte: 1,56 TB auf HF; Trending #1 innerhalb 30 Minuten nach Upload.
- Sparsity: 16/896 Experts aktiv — 1,8 % Dichte.
- FlashKDA: 1,72–2,22× Prefill auf H20.
- Task-Kosten: ~0,95 USD (AA) vs. Fable 5 ~2,4 USD (−60 %) vs. GLM-5.2 ~0,47 USD.
- Wettbewerb: Qwen3.8-Max-Preview (24T) drei Tage später — „3T-Club“ eskaliert.
Primärquellen — nach Release erneut verifizieren:
Moonshot AI — Kimi K3 Tech Blog
Hugging Face moonshotai (K3-Gewichte)
Artificial Analysis Intelligence Index
Produktionsmuster für DACH-Teams: K3-Inferenz über Moonshot-API oder OpenRouter (DSGVO-Dokumentation!), Agent-Orchestrierung und iOS-CI/CD auf VPSNIX M4/M4 Pro Physikknoten — 100 % Apple-Hardware, Root-Zugriff, kein Hypervisor-Overhead, flexible Tages-/Monatsabrechnung. Cloud-LLMs ersetzen keine Xcode-Signierung oder Metal-Debug auf virtualisiertem macOS. K3 braucht 64 GPUs; macOS-Agents brauchen native Silizium-Hardware. Preise prüfen.
SECTION 06 FAQ
Ist Kimi K3 ein Open-Source-Modell?
Nein im OSI-Sinn. Open Weight: Gewichte, Tech Report, Teile der Infra sind öffentlich; Trainingsdaten und vollständiger Code nicht.
Darf Kimi K3 kommerziell genutzt werden?
In den meisten Fällen ja. Bei MaaS-Umsatz > 20 Mio. USD/Jahr oder MAU > 100 Mio./Monatsumsatz > 20 Mio. USD gelten Zusatzbedingungen.
Wie viele GPUs für Self-Hosting?
Offiziell 64+ GPUs Supernode. Für die Mehrheit: API oder OpenRouter.
Wie stark ist K3 in Benchmarks?
Stärkstes Open-Weight-Modell, AA Index ~57 (weltweit #3). Teurer pro Task als GLM-5.2.
K3 vs. K2 — was ist neu?
~3× Parameter vs. K2.5, AttnRes, Per-Head Muon, 1M Kontext, Vision. Lizenz: neue MaaS-Schwellen.