Wer kimi k3 open weights evaluiert oder Self-Hosting vor dem Hugging-Face-Drop plant, braucht harte Zahlen statt Marketing: Moonshot AI veröffentlicht am 27. Juli 2026 die vollständigen 2,8-Billionen-Parameter-Gewichte von Kimi K3 (MoE, 1.048.576 Token Kontext) unter Modified MIT. Dieser Artikel liefert Timeline, Spezifikationstabelle, Benchmarks gegen Claude Fable 5 und GPT-5.6 Sol, API-Kosten mit Caching, Hardware-Realität und eine Release-Day-Checkliste. Fazit: K3 ist kein Fable-5-Killer — Intelligence Index 57,1 (Rang 3/189) — aber liefert Frontier-Nähe zu ~1/3 der Task-Kosten plus echtes 1M-Kontext-Self-Hosting, das Closed APIs auf eigener Infrastruktur nicht bieten.
SECTION 01 Fünf Datenpunkte, die Kimi K3 Open Weights missverständlich machen
- Zwei Launch-Daten, ein Modell: API und Kimi-Apps ab 16. Juli; Gewichtsdateien ab 27. Juli. Suchintents divergieren — Vermischung kostet Featured-Snippet-Tauglichkeit.
- Open Weights ≠ Open Source: Checkpoints ja, Trainingscode und Datensätze nein. Präzise Terminologie schützt Glaubwürdigkeit in ML-Foren.
- Self-Hosting-Headlines lügen durch Auslassung: ~1,4 TB bei 4-bit; offizielle Empfehlung 64+ Beschleuniger im Super-Node-Layout. Ein Laptop reicht nicht.
- Harness-Sensitivität: Moonshot räumt Reaktion auf Reasoning-Rückgabe und Over-Acting bei Mehrdeutigkeit ein — Cross-Vendor-Scores brauchen Messdatum und Caveats.
- DSGVO bei Cloud-API: Personenbezogene Prompts über platform.kimi.ai unterliegen Auftragsverarbeitung und Drittlandtransfer — Self-Hosting reduziert Expositionsfläche, ersetzt aber keine AVV-Prüfung.
SECTION 02 Kimi K3 Release-Timeline und Spezifikationen
| Datum | Ereignis |
|---|---|
| 2026-07-16 | K3 via API, Kimi App, Kimi Work, Kimi Code live; Artificial Analysis veröffentlicht unabhängige Evaluation |
| 2026-07-17 | WAIC Shanghai eröffnet; Xinhua rahmt K3 als nationalen AI-Meilenstein |
| 2026-07-27 | Vollständige 2,8T-Gewichte auf Hugging Face (Modified MIT) + Technical Report |
| Parameter | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen (2,8T) — größtes Open-Weight-Modell bisher |
| Architektur | Sparse MoE — Stable LatentMoE; 896 Experten, 16 aktiviert pro Token |
| Attention | Kimi Delta Attention (KDA, hybrid linear) + Attention Residuals (AttnRes) + Gated MLA |
| Kontextfenster | 1.048.576 Token (~1M) |
| Modalitäten | Native Vision (Text + Bild); Produkttier mit Video; Textausgabe |
| Gewichtsformat | MXFP4-Gewichte + MXFP8-Aktivierungen (native Low-Precision-Training) |
| Skalierungseffizienz | ~2,5× vs. K2 bei gleicher Compute (offiziell) |
| Training-Stabilität | Quantile Balancing, Per-Head Muon-Optimizer, SiTU-Aktivierung |
| Long-Context-Decode | KDA bis 6,3× Decode-Speedup bei 1M-Token-Kontext |
K3 positioniert sich als erstes ~3T-Open-Weight-Modell — Herausforderung an Closed-Source-Preisaufschläge, kein Claim, jeden Frontier-Benchmark zu dominieren.
SECTION 03 Benchmarks: Kimi K3 vs. Claude Fable 5 und GPT-5.6 Sol
Artificial Analysis Intelligence Index (Lauf vom 16. Juli 2026):
| Modell | Score | Rang |
|---|---|---|
| Claude Fable 5 | 59,9 | 1 |
| GPT-5.6 Sol | 58,9 | 2 |
| Kimi K3 | 57,1 | 3 / 189 |
K3 gewinnt oder gleicht: Frontend Code Arena #1; Automation Bench und SpreadsheetBench 2 #1; BrowseComp 91,2 (#1, bis 90,4+ mit 1M-No-Compression); SWE Marathon 42,0 (GPT-5.5/GLM-5.2 fallen auf Teens); Terminal Bench 2.1 88,3 (nahe Sol 88,8); Program Bench 77,8 (knapp über Sol 77,6); FrontierSWE 81,2 (deutlich über Sol 71,3, unter Fable 5 86,6).
K3 liegt zurück: GDPval v2 Elo 1668–1687 vs. Fable 5 1760 und Sol 1748; DeepSWE 67,5 vs. Sol 73,0; Halluzinationsrate vs. K2.6 erhöht (offiziell); Reddit-Berichte über mehr Halluzinationen als Top-Closed-Modelle; Dialog-Polish und Session-Varianz hinter Fable 5/Sol.
Architektur-Details: Kimi K3 Open-Source-LLM-Review. Alternativer Open-Weight-Kandidat: DeepSeek V4 GA-Analyse.
SECTION 04 API-Preise und effektive Kosten mit Caching
| Posten | Preis |
|---|---|
| Input (Cache Miss) | $3,00 |
| Input (Cache Hit, automatisch) | $0,30 |
| Output | $15,00 |
Höchste Tarifstufe unter chinesischen LLM-Anbietern, dennoch weit unter Claude Opus 4.8 pro Task. Artificial Analysis: $0,94 pro Task für K3 — 9,4 % unter GPT-5.6 Sol, 65,8 % unter Claude Fable 5. Coding-Workloads berichten >90 % Cache-Hit-Rate — effektive Ausgaben liegen unter Listenpreis.
SECTION 05 Ist Kimi K3 Open Source? Open Weights vs. Open Source
Am 27. Juli veröffentlicht Moonshot vollständige 2,8T-Gewichte auf Hugging Face unter Modified MIT (exakte Bedingungen am Release-Tag prüfen) plus Technical Report. vLLM-Support für KDA und Prefix Caching erwartet mit den Gewichten; Ollama/GGUF-Quantisierungen folgen typischerweise dem K2-Muster.
Präzision: K3 ist ein Open-Weight-Release — lizenzierte Checkpoints zum Download und Betrieb. Kein vollständiges Open Source mit Trainingscode und Datensätzen. Für Compliance und SEO um is kimi k3 open source ist die Unterscheidung Pflicht.
SECTION 06 Lokal betreiben? Hardware und Release-Day-Checkliste
Ehrliche Antwort: nicht auf Consumer-Hardware. 4-bit-quantisierte Gewichte allein ~1,4 TB. Offizielle Guidance: Super-Node mit 64+ Beschleunigern, Expert Parallelism plus Tensor Parallelism. Referenz: K2.7 Code (1T) benötigt ~577 GB VRAM bei INT4 — K3 ist 2,8× größer.
Self-Hosting lohnt bei: strikter Datenresidenz/Offline, Fine-Tuning auf proprietären Daten oder Call-Volumen über API-TCO. Sonst: API bei $3/$15 pro Million Token.
- Hugging-Face-Org bookmarken: Moonshot AI vor dem 27. Juli beobachten.
- LICENSE am Release-Tag prüfen: Modified MIT ≠ Standard-MIT — vollständigen Text lesen.
- Shard- und Quant-Formate verifizieren: MXFP4-Bundles und Community-INT4/GGUF prüfen.
- vLLM Release Notes tracken: KDA- und Prefix-Caching-Commit vor Produktion pinnen.
- Mindest-Hardware aus Tech Report dokumentieren: Beschleunigerzahl, Interconnect, Parallelismus gegen Cluster-Budget mappen.
- Long-Context-Tests unabhängig wiederholen: 1M-Token-Decode-Claims auf eigenem Harness validieren.
- API vs. Self-Host TCO: Strom, Netzwerk, Ops, Cache-Hit-Annahmen für Coding-Agenten einrechnen.
SECTION 07 Vier Branchenimplikationen des 27.-Juli-Drops
- Open-vs-Closed-Lücke fast geschlossen: Intelligence-Index-Spreads von Hunderten auf einstellige Punkte — Capability allein rechtfertigt keine Closed-Premiums mehr.
- Geopolitischer Kontext: K3 vor WAIC 2026; US-Delistung von Anthropic Fable/Mythos (Juli wiederhergestellt). Veröffentlichte Gewichte lassen sich nicht „undelisten“.
- China-Vendor-Welle: Z.ai GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax u. a. — K3 ist der Gipfel dieses Zyklus.
- Moonshot-Comeback: Nach DeepSeek R1 (2025, Rang 7 domestisch) rebuilt K2 → K2.5 → K3 die Open-Weight-Glaubwürdigkeit.
SECTION 08 Zitierbare Daten und Quellen
- Parameter: 2,8T gesamt; 896 MoE-Experten, 16 aktiv/Token
- Kontext: 1.048.576 Token
- Intelligence Index: K3 57,1 / Sol 58,9 / Fable 5 59,9 (AA, 16.07.2026)
- Kosten/Task: K3 $0,94 — 65,8 % unter Fable 5
- API: $3 Input Miss / $0,30 Cache Hit / $15 Output pro M Token
- Self-Host-Speicher: ~1,4 TB bei 4-bit; 64+ Beschleuniger empfohlen
- Lizenz: Modified MIT (Volltext 27.07.)
- Coding: Frontend Code Arena #1; SWE Marathon 42,0
Offizielle und unabhängige Referenzen — Links nach Upstream-Updates erneut prüfen:
Moonshot AI — Kimi K3 Technical Blog
Kimi Platform — API-Dokumentation und Preise
Artificial Analysis — Intelligence Index (16.07.2026)
K3 Open Weights verschieben die Ökonomie frontier-näher AI, kompilieren aber keine Xcode-Projekte, signieren keine iOS-Binaries und debuggen keine Metal-Shader. Virtualisierte macOS-Stacks bringen EULA-Risiko und messbaren Overhead. Produktionsmuster: K3-API (oder später Self-Host) für Million-Token-Reasoning plus VPSNIX M4/M4 Pro-Physikknoten für native Apple-Silicon-Builds — 100 % Apple-Hardware, Root-Zugriff, null Hypervisor-Steuer. Preise prüfen und Langläufer-Agenten auf compliant physischer Infrastruktur betreiben.
SECTION 09 FAQ
Wann erscheinen die Kimi K3-Gewichte?
27. Juli 2026. API und Apps ab 16. Juli; vollständige Checkpoints und Technical Report am 27. auf Hugging Face unter Modified MIT.
Ist Kimi K3 wirklich Open Source?
Open-Weight-Release — lizenzierte Checkpoints, kein Trainingscode/Datensätze. In Titeln „Open Weights“ verwenden, Nuance im Fließtext.
Was kostet Kimi K3?
API: $3/M Input (Miss), $0,30/M (Hit), $15/M Output. ~$0,94 pro Task laut Artificial Analysis — 65,8 % unter Claude Fable 5.
Läuft K3 auf Consumer-GPUs?
Nein. ~1,4 TB bei 4-bit, 64+ Beschleuniger im Super-Node empfohlen. Ohne Rechenzentrum: API nutzen.
Schlägt K3 Fable 5 oder GPT-5.6 Sol?
Gesamt-Index: nein — K3 57,1 vs. 59,9/58,9. Gewinnt Coding-/Automation-Benches, deutlich günstiger pro Task. Nach Workload wählen.
Welche Lizenz hat Kimi K3?
Modified MIT — Volltext am 27.07. auf Hugging Face. Vor kommerzieller Weiterverteilung lesen.