Wer das Grok 4.6 Release-Datum abwartet, zwischen Grok 4.5 und Kimi K3 entscheidet oder die Bedeutung von „1,5 Billionen Parametern“ quantifizieren will, braucht harte Fakten statt Hype. Elon Musk antwortete Vercel-CEO Guillermo Rauch auf X: xAI plant Grok 4.6 um den 7. August 2026 mit 1,5T Parametern, gefolgt von Grok 4.7 mit 2,1T innerhalb weniger Wochen. Datenlage heute: eine einzige X-Antwort als Primärquelle — kein Model Card, keine Benchmarks; Musks Timelines verschieben sich historisch um Tage bis Wochen. Vor Commitments offizielle xAI-Kanäle verifizieren.
SECTION 01 Fünf Datenfallen vor dem Grok-4.6-Einsatz
- Tweet ≠ Pressemitteilung: Die Infos vom 28. Juli stammen aus Musks Antwort an @rauchg. xAI-Blog und Produktseiten bestätigen weder Specs noch Termine.
- Parameter ≠ Leistung: Musk betonte SFT- und RL-Upgrades statt reiner Skalierung. Grok 4.5 konkurriert bereits über Cursor-Co-Training und Token-Effizienz auf Agent-Benchmarks.
- Benchmark-Lücke: Anders als Grok 4.5s detaillierte Model Card haben 4.6/4.7 null Drittpartei-Evaluierungen — kein harter Vergleich mit Kimi K3 oder dem gemunkelten Claude Fable 5.1.
- Wettbewerbsdruck quantifizierbar: Kimi K3 veröffentlichte am 26. Juli vollständige 2,8T Open Weights und erreichte 1.679 Punkte im Frontend Code Arena — erstes Open-Weight-Modell vor allen Closed-Modellen. xAIs komprimierter 4.6/4.7-Zeitplan reagiert direkt darauf.
- Compliance-Risiko: Im Juli verklagte xAI einen Nutzer wegen mutmaßlicher CSAM-Generierung via Grok; Common Sense Media stufte Grok im Januar als eines der schlechtesten Modelle für Kindersicherheit ein. Für Enterprise- und Jugendprodukte DSGVO-konforme Risikoanalyse neben Capability-Metriken einplanen.
SECTION 02 Timeline und Kernspezifikationen: Grok 4.5 bis 4.7
| Datum | Ereignis |
|---|---|
| 2026-07-08 | xAI liefert Grok 4.5: Coding/Agent-Flaggschiff, Cursor-Co-Training, 500K Kontext, $2/$6 pro Million Input/Output-Tokens |
| 2026-07-16–26 | Moonshot AIs Kimi K3 geht gehostet, dann vollständig Open Weight: 2,8T Parameter, 1M Kontext |
| 2026-07-28 | Musk postet Grok-4.6/4.7-Roadmap als Antwort an Rauch; am selben Tag veröffentlichen 1.200+ Mitarbeiter den Brief „Pacing the Frontier“ |
| ~2026-08-07 | Grok 4.6 Ziel: 1,5T Parameter, großes SFT/RL-Upgrade (angekündigt, nicht ausgeliefert) |
| ~Ende Aug.–Anfang Sep. 2026 | Grok 4.7 Schätzung: 2,1T Parameter; Musk: besser als 4.6 außer etwas langsamerem Serving, höhere Token-Effizienz |
| Modell | Parameter | Fokus | Status |
|---|---|---|---|
| Grok 4.3 Beta | Nicht offengelegt | Vorherige Baseline | Ausgeliefert |
| Grok 4.5 | Nicht offengelegt (Single SKU, kein MoE) | Coding/Agents, Cursor-Co-Training | Ausgeliefert |
| Grok 4.6 | 1,5T | SFT/RL-Upgrade | Angekündigt |
| Grok 4.7 | 2,1T | Breites Upgrade gegenüber 4.6 | Angekündigt |
Parameterzahlen, Preise und Benchmark-Werte stammen von Anbietern oder Musk. Grok 4.6 und 4.7 haben noch keine unabhängigen Evaluierungen — „angekündigt“-Zeilen als Richtwert bis zum offiziellen Launch behandeln.
SECTION 03 Warum das Upgrade Post-Training ist, nicht nur Skalierung
Supervised Fine-Tuning (SFT) formt Ausgaben an kuratierten Beispielen; Reinforcement Learning (RL) trainiert mehrstufige Agent-Aufgaben über Belohnungssignale. Musks Formulierung „significantly improved SFT & RL“ setzt Grok 4.5s Playbook fort: echte Cursor-Entwicklersitzungen lieferten Terminal-Bench 2.1 mit 83,3 % und SWE-Bench Pro mit 64,7 %, bei rund 15.954 Output-Tokens pro SWE-Task gegenüber 67.020 bei Opus 4.8 — ein 4,2×-Effizienzgap.
Der Sprung auf 1,5T bei Grok 4.6 ist reale Skalierung, aber Musks Grok-4.7-Framing — größer mit 2,1T, „besser in jeder Hinsicht außer etwas langsamerem Serving“ — signalisiert zwei SKUs für Qualität versus Latenz, analog zu Anthropics Sonnet/Opus-Split und OpenAIs Mini/Full-Tiers.
SECTION 04 Head-to-Head: Grok vs. Kimi K3 und Peers
| Modell | Parameter | Kontext | Preis ($/M in/out) |
|---|---|---|---|
| Grok 4.5 | Nicht offengelegt | 500K | $2 / $6 |
| Grok 4.6 (angekündigt) | 1,5T | Nicht offengelegt | Nicht offengelegt |
| Kimi K3 | 2,8T MoE | 1M | $0,30–$3 / $15 |
| Claude Fable 5.1 (Gerücht) | Nicht offengelegt | Nicht offengelegt | Gerücht Fable 5 ($10/$50) |
| GPT-5.6 Sol | Nicht offengelegt | Nicht offengelegt | Nicht offengelegt |
Grok 4.6s Ziel liegt etwa zehn Tage nach Kimi K3s Open-Weight-Release. K3 erreichte 1.679 Punkte im Frontend Code Arena — erstes Open-Weight-Modell vor allen Closed-Modellen auf diesem Board. Musk kommentierte „impressive“ in K3-Benchmark-Threads. Mehr K3-Kontext: K3 Open-Weights-Analyse; Fable-Linie: Opus 5 und Distillationskontroverse.
SECTION 05 Kontroversen: Musk Time, Klagen und Branchenspaltung
- Timeline unverifiziert: Eine einzige X-Antwort als Quelle; „Musk Time“-Verschiebungen sind bei xAI, Tesla und SpaceX üblich.
- Benchmarks und Preise leer: „1,5T“ und „SFT/RL-Upgrade“ sind Anbieterbehauptungen ohne Drittpartei-Nachweis.
- Content-Safety-Litigation: Juli 2026 verklagte xAI einen Nutzer wegen mutmaßlicher CSAM via Grok — erste Klage dieser Art, implizite Anerkennung von Bypass-Risiko. Common Sense Media markierte bereits Kindersicherheitslücken.
- Pacing-Kollision: Am Tag von Musks 4.6/4.7-Ankündigung veröffentlichten 1.200+ Mitarbeiter von OpenAI, Anthropic, Google DeepMind und Meta „Pacing the Frontier“; xAI fehlt unter den Unterzeichnern. Siehe GPT-6-Standoff und Regulierungsrennen.
Hält Musks Zeitplan, kollidieren Grok 4.6 und 4.7 mit dem gemunkelten Claude Fable 5.1 (August-Leaks) und Kimi K3s Open-Weight-Schock — der August 2026 könnte der dichteste Frontier-Modell-Monat werden. Haltbarkeit jedes Flaggschiffs schrumpft auf Wochen; Token-Effizienz und reale Task-Kosten schlagen Leaderboard-Rang allein.
SECTION 06 Sechs-Schritte-Checkliste vor Grok 4.6
- Offizielle Kanäle abonnieren: x.ai-Blog, Grok-Build-Ankündigungen, @elonmusk — nicht nur Zweitquellen.
- Grok-4.5-Baseline erfassen: SWE-Bench-, Terminal-Bench-Scores und Token-Verbrauch für Post-Launch-A/B dokumentieren.
- Cursor/OpenRouter-Fallbacks setzen: Grok 4.5 ist heute in Cursor; Kimi-K3- oder GPT-5.6-Sol-Routen für das Wechselfenster reservieren.
- Preisseite beobachten: 4.5 startete bei $2/$6 pro Million Tokens; 4.6-Preise können sich ändern — Launch-Day-Text lesen.
- Safety und DSGVO prüfen: Für Enterprise oder jugendorientierte Produkte xAI-Richtlinien, Logging, Auftragsverarbeitung und aktuelle Litigation auditieren; personenbezogene Prompts erfordern AVV und Transfer-Impact-Assessment.
- Inferenz von Compile-Stack trennen: LLM-APIs für Agent-Orchestrierung; native macOS-Builds auf physischem Apple Silicon — VM-EULA-Risiko und 20–40 % Overhead vermeiden.
SECTION 07 Zitierbare Kennzahlen und Primärquellen
- Grok 4.5: 500K Kontext; Terminal-Bench 2.1 83,3 %; SWE-Bench Pro 64,7 %; $2/$6 pro Million Tokens
- Grok 4.6 (angekündigt): 1,5T Parameter; SFT/RL-Post-Training-Fokus; Ziel ~7. August
- Grok 4.7 (angekündigt): 2,1T Parameter; Wochen nach 4.6; langsameres Serving, bessere Token-Effizienz
- Peer-Referenz: Kimi K3 2,8T, 1M Kontext, Frontend Code Arena 1.679; Grok 4.5 ~4,2× Output-Token-Effizienz vs. Opus 4.8 auf SWE-Tasks
Nach jedem Upstream-Update erneut prüfen:
Moonshot AI: Kimi K3 (Hugging Face)
The Verge: Pacing the Frontier Berichterstattung
Ein Grok-4.6-SFT/RL-Upgrade verkürzt API-Auswahlfenster weiter, ersetzt aber keine Xcode-Builds, Metal-Debugging oder iOS-Signing-Chains. VM-macOS birgt EULA-Risiko und messbaren Performance-Verlust. Pragmatischer Stack: Frontier-APIs (Grok/Kimi) für Million-Token-Agent-Orchestrierung; VPSNIX M4/M4 Pro Cloud-Physikknoten für native Apple-Silicon-Builds — echte Apple-Hardware, voller Root, null Hypervisor-Overhead, flexible Tages-/Monatsabrechnung. Siehe Preise.
SECTION 08 FAQ
Wann genau kommt Grok 4.6?
Musk nannte auf X „um den 7. August 2026“. xAI hat kein offizielles Datum bestätigt. Als verschiebbares Ziel behandeln.
Was ist der Unterschied zwischen Grok 4.6 und Grok 4.7?
Grok 4.6 hat 1,5T Parameter mit Fokus auf SFT/RL-Verbesserungen. Grok 4.7, erwartet Wochen später, hat 2,1T; Musk sagt, es übertrifft 4.6 außer bei Serving-Geschwindigkeit — etwas Latenz für bessere Token-Effizienz.
Schlägt Grok 4.6 Kimi K3 oder Claude Fable 5.1?
Zu früh. Grok 4.6 hat keine veröffentlichten Benchmarks; Kimi K3 hat verifizierte Scores inkl. Frontend Code Arena; Claude Fable 5.1 ist von Anthropic nicht offiziell bestätigt.
Was kostet Grok 4.6?
Unbekannt. Grok 4.5 startete bei $2 pro Million Input- und $6 pro Million Output-Tokens — sinnvoller Referenzwert, aber 4.6-Preise sind nicht offengelegt.
Wo kann ich Grok 4.6 nutzen?
Basierend auf Grok 4.5s Rollout: zuerst Grok Build, xAI API und Console, dann Drittplattformen — für 4.6 noch nicht bestätigt.