Wer 2026 ein Open-Source-LLM für Code-Agenten evaluiert oder noch auf deepseek-chat setzt, muss den DeepSeek V4 GA-Launch vom 20. Juli 2026 sofort einplanen. Dieser Artikel richtet sich an AI-Entwickler und technische Entscheider: Architektur (CSA, HCA, mHC, Muon), Benchmarks gegen GPT-5.6 und Claude Fable 5, Spitzen-/Nebenzeiten-Tarife sowie die API-Migration bis 24. Juli. Fazit vorab: V4 schlägt Closed-Source-Flaggschiffe noch nicht, liefert aber die stärkste Open-Source-Leistung zu 1/10 bis 1/100 der Kosten — Spitzenzeiten verdoppeln die Rechnung, doch $0,87/M Output bleibt wettbewerbsfähig.
SECTION 01 Drei Risiken beim DeepSeek V4 GA-Start
- Legacy-Endpunkte fallen weg:
deepseek-chatunddeepseek-reasonerwerden am 24. Juli 2026, 23:59 Uhr (Peking) dauerhaft abgeschaltet — nicht migrierte Produktionsservices brechen sofort ab. - Erstmalige Spitzen-/Nebenzeiten-Abrechnung: Werktags 09:00–12:00 und 14:00–18:00 (Peking) verdoppeln die Sätze; 24/7-Pipelines ohne Scheduling riskieren Budgetüberschreitungen.
- Cloud-API ersetzt keine Build-Kette: Selbst V4-Pro kompiliert nicht zuverlässig auf virtualisiertem macOS; ergänzt die Infrastrukturrechnung aus dem Mac-mini-M4-Mieten-vs.-Kaufen-Vergleich.
- Datenschutz in der EU: Bei Verarbeitung personenbezogener Prompts über die Cloud-API gelten DSGVO-Anforderungen an Auftragsverarbeitung; MIT-lizenzierte Self-Hosting-Optionen reduzieren Transferrisiken gegenüber reinen Closed-Source-APIs.
SECTION 02 Zeitstrahl: Von der Preview zum GA am 20. Juli 2026
| Datum | Ereignis |
|---|---|
| 2026-04-24 | V4-Preview + Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B) |
| 2026-05 | Produktions-Tuning für Flash und Pro, API allgemein verfügbar |
| 2026-06 | V4-Pro-Output dauerhaft −75 % auf $0,87/M Token |
| 2026-06-29 | E-Mail an alle API-Nutzer: GA Mitte Juli, erste Offenlegung Spitzen-/Nebenzeiten |
| 2026-07-19 | GA-Grauzonen-Zugang für ausgewählte Entwickler, Medienberichte zum Launch |
| 2026-07-20 | GA-Release offiziell live |
| 2026-07-24 | deepseek-chat und deepseek-reasoner endgültig offline |
Kurzfassung: Die Preview war bereits stark; GA verbessert Agent-Fähigkeiten, Mathematik und Code-Generierung und führt ein diszipliniertes Preismodell ein — von „fast gratis“ zu nachvollziehbarer Kommerzialisierung.
SECTION 03 V4-Pro und V4-Flash: CSA, HCA, mHC, Muon und drei Inferenzmodi
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktive Parameter/Token | 49 Milliarden (49B) | 13 Milliarden (13B) |
| Transformer-Schichten | 61 | 43 |
| Kontextfenster | 1.000.000 Tokens | 1.000.000 Tokens |
| Max. Output | 384K Tokens | 384K Tokens |
| Präzision | FP4 (Experten) + FP8 (Rest) | FP4 + FP8 gemischt |
| Pretraining | 33T+ Tokens | 32T+ Tokens |
| Lizenz | MIT | MIT |
V4 verzichtet auf MLA aus V2/V3 zugunsten eines Hybrids aus Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA): CSA komprimiert die KV-Sequenz per Softmax-Gating 4×, nutzt einen FP4-„Lightning Indexer“ für top-k-Sparsity (Pro: top-1024, Flash: top-512) und behält ein 128-Token-Sliding-Window; HCA komprimiert 128× für globale Dense-Attention. Bei 1M Kontext: nur 27 % Inferenz-FLOPs gegenüber V3.2, KV-Cache-Speicher 10 % (Flash: 7 %).
Manifold-Constrained Hyper-Connections (mHC) stabilisieren 61 Schichten via 4-Kanal-Residualfluss und doppelt-stochastische Matrizen. Training mit Muon-Optimierer (Newton-Schulz-Orthogonalisierung) statt AdamW — schnellere, stabilere Konvergenz.
| Modus | Merkmale | Einsatz |
|---|---|---|
| Non-think | Keine Chain-of-Thought, minimale Latenz | Einfache Q&A, Routing |
| Think High | Explizites Reasoning (Thinking-Tags) | Mittlere Komplexität, Code-Debug |
| Think Max | Maximale Reasoning-Tiefe, 384K+ Kontext | Mathematik, lange Agent-Ketten |
Empfohlene Sampling-Parameter: temperature=1.0, top_p=1.0 (alle Modi).
SECTION 04 Benchmarks: SWE-bench 80,6 % und Kostenverhältnis 116×
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % | 96,0 % | nicht separat veröffentlicht | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified misst echte GitHub-Bugfixes — 80,6 % ist der Open-Source-Rekord, gleichauf mit Gemini 3.1 Pro. Laut Artificial Analysis kostet Claude Fable 5 im Strategy-&-Ops-Index $3,48 pro Lauf (50 Punkte), V4-Pro $0,03 (38 Punkte) — Fable 5 ist 116× teurer bei nur ~12 Punkten Vorsprung (~31 %).
SECTION 05 Vergleich GPT-5.6 / Claude Fable 5 und Spitzen-/Nebenzeiten-Tabelle
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source / Self-Host | MIT | Nein | Nein |
| Kontextfenster | 1M Tokens | nicht offengelegt | 1M Tokens |
| API-Output (Nebenzeit) | $0,87/M | ~$15/M | $50/M |
| API-Output (Spitzenzeit) | $1,74/M | — | — |
| Code-Fähigkeit | Sehr stark (nahe Fable 5) | Sehr stark | Spitze |
| Datenschutz / DSGVO | Private Deployment möglich | Cloud-only | Cloud-only |
Szenario-Matrix: Budget / hohe Frequenz / Self-Host → V4-Pro oder V4-Flash; maximale Code-Qualität → Claude Fable 5; komplexe Mathematik → GPT-5.6 Sol/Ultra; Massen-Log-Analyse → V4-Flash (Cache-Hit-Input ab $0,0028/M). Kontext zu Kimi K3 (2,8T Open Source) hilft bei der Gesamt-LLM-Strategie.
| Modell | Position | Nebenzeit (Off-Peak) | Spitzenzeit (Peak) |
|---|---|---|---|
| V4-Pro | Input (Cache-Hit) | ¥0,025 / $0,0035 / 1M | 2× |
| V4-Pro | Input (Cache-Miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 / 1M |
| V4-Pro | Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 / 1M |
| V4-Flash | Input (Cache-Hit) | ¥0,02 / $0,0028 / 1M | 2× |
| V4-Flash | Input (Cache-Miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 / 1M |
| V4-Flash | Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 / 1M |
Spartipps: Batch-Jobs nach 18:00 oder vor 09:00 legen; Prompt Cache für hohe Hit-Rate; einfaches Routing auf Flash, schwere Reasoning auf Pro. Selbst in Spitzenzeiten ist V4-Pro-Output $1,74/M — 8,6× günstiger als Claude Opus 4.8 ($15/M).
SECTION 06 API-Migration bis 24. Juli: sechs Schritte und Python-Beispiel
Warnung: deepseek-chat und deepseek-reasoner enden am 24. Juli 2026, 15:59 UTC (23:59 Peking) dauerhaft.
| Altes Modell | Neues Modell | Hinweis |
|---|---|---|
deepseek-chat |
deepseek-v4-flash (Non-think) |
Schnell, leichte Aufgaben |
deepseek-reasoner |
deepseek-v4-flash (Think-Modus) |
oder Upgrade auf deepseek-v4-pro |
- Codebase durchsuchen: Repos, CI und Umgebungsvariablen auf
deepseek-chat/deepseek-reasonerprüfen. - Zielmodell wählen: Leichte Dialoge →
deepseek-v4-flash; komplexes Reasoning →deepseek-v4-pro. - OpenAI SDK anpassen: Nur
modeländern,base_url=https://api.deepseek.combeibehalten. - Thinking-Modus (optional): Via
extra_bodyaktivieren — ersetztdeepseek-reasoner. - Staging-Lasttest: Latenz, Token-Abrechnung und Spitzen-/Nebenzeiten-Rechnung validieren.
- Grauzonen-Rollout vor 24.07.: Produktion umschalten, Fehlerrate überwachen; DeepSeek kündigt Preisänderungen 24 h per E-Mail an.
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Analysiere diesen Swift-Code auf Performance-Engpässe..."}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 unterstützt OpenAI ChatCompletions und Anthropic Messages; bei Anthropic SDK bleibt base_url unverändert, model auf deepseek-v4-pro setzen.
SECTION 07 Zitierbare Kennzahlen, Quellen und Infrastruktur-Empfehlung
- KV-Cache: Bei 1M Kontext nur 10 % Speicher vs. V3.2 (Flash: 7 %)
- Inferenz-FLOPs: 27 % gegenüber V3.2 bei 1M Szenario
- Kostenverhältnis: V4-Pro $0,03 vs. Fable 5 $3,48 pro Task — Faktor 116
- Spitzenzeit: Output $1,74/M = 1/8,6 von Opus 4.8
- Migrationsfrist: 2026-07-24 23:59 Peking
- Sampling: temperature=1.0, top_p=1.0
Offizielle und unabhängige Quellen — nach Updates erneut prüfen:
DeepSeek API — offizielle Dokumentation
arXiv:2606.19348 — DeepSeek V4 Technikpaper
Artificial Analysis — Modell-Kostenvergleich
DeepSeek V4 GA ist 2026 der wichtigste Open-Source-Meilenstein — nicht weil es Claude Fable 5 oder GPT-5.6 schlägt, sondern weil es Spitzenleistung zu Bruchteilskosten liefert. Doch Cloud-LLMs ersetzen weder Xcode-Builds noch Metal-Debug noch iOS-Zertifikatsketten; virtualisiertes macOS birgt EULA-Risiken und 20–40 % Verlust. Bewährtes Setup: V4-API für Langkontext und Agent-Orchestrierung, VPSNIX M4/M4-Pro-Physikknoten für native Kompilierung und 7×24-Agenten — 100 % Original-Hardware, voller Root-Zugriff, null Hypervisor-Overhead. Preise auf der Preisseite; wer den Kimi-K3-Vergleich gelesen hat, sollte Compute in complianten Physikumgebungen verankern statt auf einen einzelnen API-Anbieter zu setzen.
SECTION 08 FAQ
Was unterscheidet GA von der Preview?
Gleiche Architektur; GA verbessert Agent, Mathematik und Code, führt Spitzen-/Nebenzeiten ein. Alte Endpunkte enden am 24. Juli.
Wann gilt der Spitzenpreis?
Werktags 09:00–12:00 und 14:00–18:00 Peking — Faktor 2×; außerhalb Nebenzeitpreise.
V4-Pro oder V4-Flash?
Flash für leichtes Routing und hohe Frequenz (Output $0,28/M); Pro für komplexes Reasoning und Code (Output $0,87/M, SWE-bench 80,6 %).
Self-Hosting unter DSGVO?
Ja — MIT-Lizenz erlaubt private Deployment; 1,6T erfordert großes GPU-Cluster. Für EU-Prompts oft wirtschaftlicher als reine Cloud-API mit Drittlandtransfer.