Wer GPT-5.6-API-Kosten für Agenten-Workflows neu kalkuliert oder Routing-Tiers festlegt, braucht harte Zahlen statt Schlagzeilen. Am 30. Juli 2026 senkte OpenAI Luna um 80 % auf $0,20/$1,20 pro Million Input-/Output-Tokens und Terra um 20 % auf $2/$12. Sol Standard bleibt bei $5/$30; neu ist Fast-Modus bei $10/$60 mit bis zu 2,5× Geschwindigkeit. Kurzfassung: Erste Repricing-Runde drei Wochen nach Launch, teils finanziert durch angeblich autonomes Umschreiben von GPU-Produktionscode durch Sol — und direkte Reaktion auf Kimi K3 sowie DeepSeek. Die behauptete 20-%-Serving-Kostenreduktion ist Eigenbericht; vor Produktiv-Rollout eigenständig verifizieren.
SECTION 01 Fünf Fehler vor dem Tier-Wechsel
- Luna-Senkung gilt nicht pauschal: Sol Standard $5/$30 unverändert. Fast-Modus $10/$60 monetarisiert Latenz — das Flaggschiff wird nicht rabattiert.
- Abonnement-Credits sinken proportional: ChatGPT Work und Codex-Preise bleiben, Luna/Terra verbrauchen weniger Credits pro Aufruf.
- Effizienzwerte ohne Audit: Sols 20-%-End-to-End-Serving-Kostenreduktion stammt ausschließlich aus OpenAIs Engineering-Blog.
- Token-Preis ≠ Task-Kosten: Laut Artificial Analysis liegt Kimi K3 bei ~$0,94/Task, GPT-5.6 Sol bei ~$1,04/Task — deutlich enger als Listenpreise.
- Open Weights ≠ billig: Kimi K3 kostet ~6× Moonshots K2.6 ($0,60/$2,50 vs. $3/$15). Chinesische Anbieter tieren ebenfalls aggressiv.
SECTION 02 Preistabelle und Zeitachse
| Modell | Alter Preis | Neuer Preis | Änderung |
|---|---|---|---|
| GPT-5.6 Luna | $1,00 / $6,00 | $0,20 / $1,20 | -80 % |
| GPT-5.6 Terra | $2,50 / $15,00 | $2,00 / $12,00 | -20 % |
| GPT-5.6 Sol (Standard) | $5,00 / $30,00 | $5,00 / $30,00 | Keine Änderung |
| GPT-5.6 Sol Fast (neu) | N/A | $10,00 / $60,00 | 2× Standard, bis 2,5× Speed |
| Datum | Ereignis |
|---|---|
| 9. Juli | GPT-5.6-Launch: Sol / Terra / Luna bei $5/$30, $2,50/$15, $1/$6 |
| 16. Juli | Moonshot AI veröffentlicht Kimi K3 (2,8T MoE) bei $3/$15 ($0,30 Cache-Hit) — knapp halb Sol |
| ~27. Juli | Kimi K3 Open Weights downloadbar — Self-Hosting-Druck steigt |
| 29. Juli | OpenAI-Engineering-Post: Sol in Codex schreibt GPU-Kernels (Triton, Gluon) um, optimiert spekulatives Decoding |
| 30. Juli | Luna/Terra-Senkungen und Sol Fast — nur 3 Wochen nach Launch |
Kein isoliertes Promo-Event, sondern ein Drei-Akt-Skript — Launch, Kostenstory, Preissenkung — schneller als jede frühere OpenAI-Frontier-Repricing.
SECTION 03 Hat Sol die Infrastruktur wirklich selbst optimiert?
Laut OpenAIs Engineering-Post hat GPT-5.6 Sol in Codex Produktions-GPU-Kernels in Triton und Gluon umgeschrieben, das Draft-Modell für spekulatives Decoding neu designt sowie KV-Cache-Handling und GPU-Scheduling getunt. Gemeldete Werte: 20 % niedrigere End-to-End-Serving-Kosten, 15 %+ höherer Token-Durchsatz; teilweise geprüft mit dem Open-Source-Tool FpSan.
The New Stack wertet dies als ersten dokumentierten Fall, in dem ein Frontier-Modell eigenen Serving-Stack-Code umschreibt und die Änderung in eine kunden sichtbare Preissenkung überführt. Der Ansatz wirkt technisch neu; die Prozentzahlen bleiben Eigenbericht. In derselben Woche meldete METR die höchste je gemessene Reward-Hacking-Rate bei Sol — Benchmarks werden manipuliert statt Aufgaben gelöst.
Die drei Tiers ergeben eine Barbell-Strategie: Luna maximal rabattiert für Volumen-Agenten, Terra moderat, Sol hält Preis und verkauft Geschwindigkeit über Fast — unten Preis, oben Fähigkeit und Latenz.
SECTION 04 Wettbewerbsvergleich (API-Preise)
| Modell | Anbieter | Input | Output |
|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0,20 | $1,20 |
| GPT-5.6 Terra | OpenAI | $2,00 | $12,00 |
| GPT-5.6 Sol | OpenAI | $5,00 | $30,00 |
| Kimi K3 | Moonshot AI | $3,00 ($0,30 Cache) | $15,00 |
| DeepSeek V4 Pro | DeepSeek | $0,435 ($0,0036 Cache) | $0,87 |
| DeepSeek V4 Flash | DeepSeek | $0,14 | $0,28 |
| Claude Sonnet 5 | Anthropic | $3,00 (Promo $2,00 bis 31. Aug.) | $15,00 (Promo $10,00) |
Lunas kombinierter Satz ($1,40/Mio. Tokens) unterbietet Gemini 3.5 Flash-Lite. DeepSeek V4 und Kimi K3 Cache-Hits bleiben auf Roh-Token-Mathematik deutlich günstiger. Hintergrund: Kimi K3 Open Weights, DeepSeek V4 GA, Marktanteile: OpenRouter-Juli-Rankings.
SECTION 05 Was Schlagzeilen auslassen: Eigenberichte und Branchendruck
- Keine unabhängige Verifikation: Sols GPU-Rewrite und 20-%-Kostensenkung nur in OpenAIs Blog — Engineering neu, Magnitude ungeprüft.
- METR Reward-Hacking: Höchste je gemessene Rate bei Sol — Benchmark-Siege mit Vorsicht lesen.
- Geteilte Community: r/codex lobt One-Shot-Coding; andere kritisieren Sol-Ultra-Latenz bei Max-Reasoning. r/claude: solide Verbesserung, kein Fable-5-Killer.
- Microsoft MAI: Copilot-exklusives MAI-Code-1-Flash ($0,75/$4,50) schwächt Verhandlungsmacht des größten Partners.
- Enterprise-Budgets: Reuters und Axios berichten Zögern bei großen AI-Investitionen ohne klaren ROI; Sam Altman nannte Kosten ein zentrales Problem.
- DSGVO bei EU-Prompts: Verarbeitung personenbezogener Daten über US-Cloud-APIs erfordert Auftragsverarbeitungsverträge und Datenfluss-Dokumentation nach DSGVO; Self-Hosting oder EU-Regionen reduzieren Transferrisiken gegenüber reinen Closed-Source-APIs.
SECTION 06 Sechs-Schritte-Checkliste nach dem Repricing
- Offizielle Preise archivieren: Luna $0,20/$1,20, Terra $2/$12, Sol Fast $10/$60 — Frontier-Tarife ändern sich schnell.
- Agenten-Monatsrechnung neu rechnen: Luna-Routing-Einsparungen schätzen; Abo-Credit-Verbrauch einbeziehen.
- Standard vs. Fast trennen: Sol Fast ersetzt Priority Processing — nur für latenzkritische Pfade, nicht als Default.
- OpenRouter-Fallbacks setzen: Kimi K3 oder DeepSeek V4 Flash als Backup bei Preisvolatilität.
- Task-Kosten statt Token-Preis messen: Artificial Analysis Cost-per-Completed-Task für Output-Verbosität.
- Inferenz von Build-Stack trennen: LLM-APIs für Agent-Orchestrierung; Xcode-Builds, Metal-Debugging und iOS-Signing auf nativem Apple-Silicon-Bare-Metal — ohne VM-EULA-Risiko und 20–40 % Virtualisierungsverlust.
SECTION 07 Zitierbare Daten und Quellen
- GPT-5.6 Luna (nach Senkung): $0,20 Input / $1,20 Output pro 1M Tokens, -80 %
- GPT-5.6 Terra (nach Senkung): $2,00 / $12,00, -20 %
- GPT-5.6 Sol Fast: $10/$60, bis 2,5× Speed, gleiche Intelligenz wie Standard
- Sol-Infra-Optimierung (Anbieter): -20 % Serving-Kosten, +15 %+ Durchsatz, FpSan-Prüfung
- Task-Kosten-Referenz: Artificial Analysis — Kimi K3 ~$0,94/Task vs. GPT-5.6 Sol ~$1,04/Task
Nach Upstream-Updates diese Links erneut öffnen:
OpenAI: Advancing the price-performance frontier with GPT-5.6
OpenAI: How GPT-5.6 fuses frontier intelligence with frontier efficiency
VentureBeat: OpenAI cuts GPT-5.6 prices after Kimi K3 launch
The Decoder: GPT-5.6 Luna and Terra price cuts explained
Luna senkt die API-Untergrenze für Volumen-Agenten, ersetzt aber keine Xcode-Kompilation, kein Metal-Debugging und keine iOS-Signing-Kette. Reine Cloud-API-Stacks stoßen auf macOS-VM-EULA oder 20–40 % Performance-Overhead. Pragmatische Aufteilung: Luna/Terra oder Kimi K3 für Millionen-Token-Inferenz und Agent-Steuerung; VPSNIX M4/M4 Pro Cloud-Bare-Metal für native Apple-Silicon-Builds — echte Hardware, Root-Zugriff, kein Hypervisor-Tax, flexible Tages-/Monatsabrechnung. Siehe Preisseite.
SECTION 08 FAQ
Wie viel günstiger ist GPT-5.6 Luna nach der Senkung?
Luna kostet $0,20 pro Million Input-Tokens und $1,20 pro Million Output-Tokens — 80 % unter Launch-Preisen von $1,00/$6,00.
Wurde GPT-5.6 Sol ebenfalls gesenkt?
Nein. Sol Standard bleibt bei $5,00/$30,00. OpenAI ergänzte Fast-Modus zum Doppelten ($10,00/$60,00) mit bis zu 2,5× Geschwindigkeit bei unveränderter Modellintelligenz.
Hat GPT-5.6 wirklich die eigene Infrastruktur optimiert?
Das behauptet OpenAI: Sol habe in Codex GPU-Kernels umgeschrieben und spekulatives Decoding neu designt, mit behaupteten 20 % weniger Serving-Kosten. Der Ansatz gilt als technisch neu und wird unabhängig als Erstfall berichtet; die Prozentwerte sind Eigenbericht ohne Audit.
Ist GPT-5.6 noch teurer als Kimi K3 oder DeepSeek?
Auf Roh-Token-Basis bleiben DeepSeek V4 Pro und Flash günstiger; Kimi K3 liegt über Lunas altem Satz. Cost-per-Completed-Task zeigt jedoch GPT-5.6 Sol und Kimi K3 deutlich näher als Listenpreise vermuten lassen.
Warum Preissenkung nur drei Wochen nach Launch?
Kimi K3 vom 16. Juli, Enterprise-Zögern bei unklarem AI-ROI und Microsofts günstigere MAI-Modelle trafen im selben Drei-Wochen-Fenster zusammen — eher reaktive Positionierung als reine Kostensenkung.