Startseite / Blog / Kimi K3
ENGINEERING_BLOG · 2026.07.17

Kimi K3 im Test: 2,8 Billionen Parameter — Open-Source-Rekord 2026

KIMI K3 · Gesamtparameter
2.8T

Ca. 75 % über DeepSeek V4 Pro (1,6T) — bislang größtes Open-Source-KI-Modell weltweit.

Wer 2026 ein Open-Source-LLM für Code-Generierung evaluiert oder Apple-Ökosystem-Entwicklung mit KI-Agenten kombiniert, sollte Kimi K3 von Moonshot AI (16. Juli 2026) sofort auf die Shortlist setzen. Dieser Artikel richtet sich an Entwickler und technische Entscheider: MoE-Architektur mit 2,8 Billionen Parametern, drei Engineering-Innovationen (KDA, AttnRes, Stable LatentMoE), Benchmarks gegen Claude Fable 5 und GPT-5.6 Sol, API-Preise sowie der Open-Source-Zeitplan vom 27. Juli. Fazit vorab: K3 konkurriert bei langen Code-Sessions mit Closed-Source-Flaggschiffen, ersetzt aber weder Xcode-Kompilierung noch Metal-Debugging — Cloud-API und native M4-Physikknoten ergänzen sich.

SECTION 01 Drei typische Fallstricke bei der LLM-Wahl für Code

  • Kontextfenster vs. Realität: Viele Modelle werben mit 200K+ Tokens, brechen bei Repo-weiten Analysen dennoch ab. K3 bietet 1 Mio. Tokens zum Standardtarif — relevant für monolithische Codebasen.
  • Benchmark-Scores ≠ Produktionslast: Hohe SWE-Kurztestwerte garantieren keine stundenlangen Coding-Sessions. SWE Marathon simuliert anhaltende Arbeit am nächsten — K3 führt mit 42,0.
  • API-LLM ersetzt keine Build-Umgebung: Selbst starke Cloud-Modelle laufen nicht stabil auf virtualisiertem macOS für Xcode-Signierung und Metal-Shader-Debug. Ergänzt die Kostenrechnung aus dem Mac-mini-M4-Mieten-vs.-Kaufen-Vergleich.
  • Open-Source-Versprechen vs. Betriebsaufwand: 2,8T Parameter erfordern für Produktion 64+ Beschleunigerkarten; bis zum 27. Juli bleiben API oder kimi.com die praktikablen Wege. Bei Verarbeitung personenbezogener Prompts in der EU gelten zusätzliche DSGVO-Anforderungen an Auftragsverarbeitung und Datenresidenz.

SECTION 02 Was ist Kimi K3 — und warum der Launch-Zeitpunkt zählt

Am 16. Juli 2026 erschien Kimi K3 ohne große Keynote: ein Banner in der API-Dokumentation, ein Technikblog und sofort aufrufbare Modell-ID kimi-k3.

Kurzdefinition: Kimi K3 ist mit 2,8 Billionen (2,8T) Parametern das größte Open-Source-KI-Modell — rund 75 % über DeepSeek V4 Pro (1,6T) und das 2,7-Fache von Xiaomis Open-Source-Modell (1,02T). Sparse-MoE-Architektur: 16 von 896 Experten aktiv (1,8 % Sparsity); 1 Mio. Token Kontext; native Vision. Vollständige Gewichte ab 27. Juli 2026 auf Hugging Face.

Kimi K3 — Kerndaten
Dimension Wert
Gesamtparameter 2,8 Billionen (2,8T)
Architektur KDA + AttnRes + Stable LatentMoE
Aktive Experten 16 / 896 (Sparsity 1,8 %)
Kontextfenster 1.048.576 Tokens (1M)
Eingabemodalitäten Text, Bild, Video
API-Preis $3 / $15 pro Mio. Token (Input/Output)
Gewichte Open Source 27. Juli 2026

Strategischer Kontext: Kimi dominierte in 9 von 12 Monaten die Open-Source-Größenklasse; Launch kurz vor der WAIC 2026; ARR über $300 Mio. (Stand Juni 2026), Bewertung $31,5 Mrd.; API-Anteil >70 %, internationale zahlende Nutzer +400 %.

SECTION 03 Drei Architektur-Innovationen: KDA, AttnRes, Stable LatentMoE

Kimi Delta Attention (KDA) — hybride lineare Aufmerksamkeit im Verhältnis 3:1 (drei lineare Schichten, eine Full-Attention-Schicht). KV-Cache-Speicher bis −75 %; bei 1M Tokens Decode bis +6,3×; übertrifft reine Full-Attention-Baselines in Kurz-, Langkontext- und RL-Skalierungsszenarien.

Attention Residuals (AttnRes) — modifizierte Tiefen-Residualverbindungen mit selektivem Abruf früherer Layer-Repräsentationen. Moonshot meldet ~25 % Trainingseffizienz bei <2 % Extra-Compute.

Stable LatentMoE — bei 896 Experten und nur 16 aktiven: Quantile Balancing, Per-Head Muon, Sigmoid Tanh Unit (SiTU) und Gated MLA. Gegenüber Kimi K2 etwa 2,5× bessere Skalierungseffizienz.

KDA funktioniert wie ein effizientes Indexsystem: meist schnelle Nachschläge, bei Bedarf präzise Vollabrufe — statt jede Detailinformation dauerhaft im Arbeitsspeicher zu halten.

SECTION 04 Benchmarks: Kimi K3 vs. Claude Fable 5 vs. GPT-5.6 Sol

Moonshot-eigene Kernbenchmarks (16.07.2026)
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE 67,5 70,0 73,0 59,0
Program Bench 77,8 76,8 77,6 71,9
Terminal Bench 2.1 88,3 84,6 88,8 84,6
FrontierSWE 81,2 86,6 71,3 66,7
SWE Marathon 42,0 35,0 39,0 40,0
BrowseComp 91,2 88,0 90,4 84,3
OmniDocBench 91,1 89,8 85,8 87,9
GPQA-Diamond 93,5 92,6 94,1 91,0

Interpretation: SWE Marathon misst anhaltende Code-Arbeit — K3 führt deutlich. Program Bench und OmniDocBench ebenfalls Spitze. Im Artificial Analysis Intelligence Index v4.1: K3 mit 57,1 auf Platz 4 hinter Claude Fable 5 (59,9) und GPT-5.6 Sol (58,9). Hinweis: Hersteller-eigene Zahlen; unterschiedliche Inference-Harnesses (Kimi Code, Codex, Claude Code) — unabhängige Reproduktion läuft noch.

SECTION 05 Preisvergleich und sechs Schritte zur Kimi-K3-Anbindung

API-Preise im Vergleich ($/Mio. Token)
Modell Input Output Cache-Hit Input Kontext
Kimi K3 $3,00 $15,00 $0,30 1M
Claude Sonnet 5 $3,00 $15,00 200K
Claude Opus 4.8 $5,00 $25,00 200K
GPT-5.5 $5,00 $30,00 400K
DeepSeek V4 Pro $1,74 $3,48 $0,145 128K
Kimi K2.6 $0,95 $4,00 $0,16 256K

K3 kostet wie Claude Sonnet 5 ($3/$15), bietet aber fünffaches Kontextfenster; Cache-Hit ab $0,30/M — in Coding-Szenarien oft >90 % Trefferquote. China-API: ¥20/M Input, ¥100/M Output; kimi.com kostenlos testbar.

  1. Webbrowser ohne Code: kimi.com öffnen, Account anlegen (Google-Login möglich), K3 läuft standardmäßig mit maximaler Inferenzstärke.
  2. Moonshot API-Key beantragen: Auf platform.kimi.ai Schlüssel erstellen, Guthaben und Rate-Limits prüfen.
  3. OpenAI-kompatiblen Client konfigurieren: base_url=https://api.moonshot.ai/v1, Modell-ID kimi-k3.
  4. Erstaufruf validieren: Kurzer Prompt, Token-Abrechnung und Latenz gegen Erwartung prüfen.
  5. (Optional) OpenRouter: Modell-ID moonshotai/kimi-k3, offizielle Preise ohne Aufschlag, 1M Kontext erhalten.
  6. 27. Juli im Kalender: Hugging-Face-Repository beobachten; vLLM/SGLang-Quantisierung und Self-Hosting-Schwelle (64+ Karten) bewerten.
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analysiere diesen Code auf Performance-Engpässe..."}]
)

SECTION 06 Szenario-Matrix, Open-Source-Zeitplan und harte Kennzahlen

Modellwahl nach Anwendungsfall
Szenario Empfehlung Begründung
Anhaltende Code-Sessions Kimi K3 SWE Marathon führend, längstes Kontextfenster
Komplexe Repo-Bugfixes Claude Fable 5 FrontierSWE deutlich vorn
Terminal-/Toolchain-Agenten GPT-5.6 Sol Terminal Bench Spitzenwert
Lange Dokumente / Multimodal Kimi K3 OmniDocBench Platz 1
Kostenoptimiert DeepSeek V4 Pro Output $3,48/M
Self-Hosting (ab 27.07.) Kimi K3 Stärkste Open-Source-Gewichte

Zitierbare Kennzahlen:

  • Parameter: 2,8T gesamt, 896-Experten-MoE, 16 aktiv (1,8 % Sparsity)
  • KDA: KV-Cache −75 %, 1M-Token-Decode +6,3×
  • AttnRes: Training +25 %, Extra-Compute <2 %
  • vs. K2: Skalierungseffizienz +2,5×
  • Intelligence Index v4.1: K3 = 57,1, weltweit Rang 4
  • ARR / Bewertung: >$300 Mio. ARR (Juni 2026), $31,5 Mrd. Pre-Money
  • Termine: WAIC 17.–20.07. → 27.07. Hugging Face Vollgewichte

Offizielle und unabhängige Quellen — nach Updates erneut prüfen:

Moonshot AI — Kimi K3 Technikblog

Kimi API Platform — Preise und Quickstart

Artificial Analysis — Intelligence Index v4.1

K3 beweist, dass Open-Source-Modelle Closed-Source-Flaggschiffe herausfordern können — doch Cloud-LLMs ersetzen weder Xcode-Builds noch Metal-Shader-Debug noch iOS-Zertifikatsketten. Virtualisiertes macOS birgt EULA-Risiken und 20–40 % Performance-Verlust. Bewährtes Setup: K3-API für Langkontext-Code und Dokumentenanalyse, VPSNIX M4/M4-Pro-Physikknoten für native Kompilierung und 7×24-Agenten — 100 % Original-Hardware, voller Root-Zugriff, null Hypervisor-Overhead, flexible Tagesmiete. Preise auf der Preisseite; wer AI-Hardware-Litigation verfolgt, sollte Compute in complianten Physikumgebungen statt in unsicheren Virtualisierungs-Setups halten.

SECTION 07 FAQ

Ist Kimi K3 kostenlos nutzbar?

Ja — kimi.com Free-Tier unterstützt K3 (derzeit nur max-Inferenzstärke). API: $3/$15 pro Mio. Token Standard.

Kann ich Kimi K3 lokal betreiben?

Vor dem 27. Juli nein. Danach erfordert Produktions-Inferenz 64+ Beschleunigerkarten — kein Laptop-Use-Case.

K3 oder DeepSeek V4 Pro?

K3: fast doppelte Parameter (2,8T vs. 1,6T), 1M vs. 128K Kontext, stärkere Benchmarks. DeepSeek: Output $3,48/M — deutlich günstiger.

Lohnt sich 1 Mio. Token Kontext?

Für Repo-weite Analyse, lange Rechts-/Forschungsdokumente und Agenten-Langzeitgedächtnis ja — K3 berechnet keine Längenzuschläge.