Startseite / Blog / DeepSeek V4
ENGINEERING_BLOG · 2026.07.20

DeepSeek V4 GA: Preise, Architektur und Lücke zu GPT-5.6

DEEPSEEK V4-PRO · SWE-bench Verified
80.6%

Open-Source-Spitzenwert, gleichauf mit Gemini 3.1 Pro; Output ab $0,87/M (Nebenzeit).

Wer 2026 ein Open-Source-LLM für Code-Agenten evaluiert oder noch auf deepseek-chat setzt, muss den DeepSeek V4 GA-Launch vom 20. Juli 2026 sofort einplanen. Dieser Artikel richtet sich an AI-Entwickler und technische Entscheider: Architektur (CSA, HCA, mHC, Muon), Benchmarks gegen GPT-5.6 und Claude Fable 5, Spitzen-/Nebenzeiten-Tarife sowie die API-Migration bis 24. Juli. Fazit vorab: V4 schlägt Closed-Source-Flaggschiffe noch nicht, liefert aber die stärkste Open-Source-Leistung zu 1/10 bis 1/100 der Kosten — Spitzenzeiten verdoppeln die Rechnung, doch $0,87/M Output bleibt wettbewerbsfähig.

SECTION 01 Drei Risiken beim DeepSeek V4 GA-Start

  • Legacy-Endpunkte fallen weg: deepseek-chat und deepseek-reasoner werden am 24. Juli 2026, 23:59 Uhr (Peking) dauerhaft abgeschaltet — nicht migrierte Produktionsservices brechen sofort ab.
  • Erstmalige Spitzen-/Nebenzeiten-Abrechnung: Werktags 09:00–12:00 und 14:00–18:00 (Peking) verdoppeln die Sätze; 24/7-Pipelines ohne Scheduling riskieren Budgetüberschreitungen.
  • Cloud-API ersetzt keine Build-Kette: Selbst V4-Pro kompiliert nicht zuverlässig auf virtualisiertem macOS; ergänzt die Infrastrukturrechnung aus dem Mac-mini-M4-Mieten-vs.-Kaufen-Vergleich.
  • Datenschutz in der EU: Bei Verarbeitung personenbezogener Prompts über die Cloud-API gelten DSGVO-Anforderungen an Auftragsverarbeitung; MIT-lizenzierte Self-Hosting-Optionen reduzieren Transferrisiken gegenüber reinen Closed-Source-APIs.

SECTION 02 Zeitstrahl: Von der Preview zum GA am 20. Juli 2026

DeepSeek V4 — Meilensteine
Datum Ereignis
2026-04-24 V4-Preview + Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B)
2026-05 Produktions-Tuning für Flash und Pro, API allgemein verfügbar
2026-06 V4-Pro-Output dauerhaft −75 % auf $0,87/M Token
2026-06-29 E-Mail an alle API-Nutzer: GA Mitte Juli, erste Offenlegung Spitzen-/Nebenzeiten
2026-07-19 GA-Grauzonen-Zugang für ausgewählte Entwickler, Medienberichte zum Launch
2026-07-20 GA-Release offiziell live
2026-07-24 deepseek-chat und deepseek-reasoner endgültig offline

Kurzfassung: Die Preview war bereits stark; GA verbessert Agent-Fähigkeiten, Mathematik und Code-Generierung und führt ein diszipliniertes Preismodell ein — von „fast gratis“ zu nachvollziehbarer Kommerzialisierung.

SECTION 03 V4-Pro und V4-Flash: CSA, HCA, mHC, Muon und drei Inferenzmodi

DeepSeek V4 — Modellfamilie
Spezifikation V4-Pro V4-Flash
Gesamtparameter 1,6 Billionen (1,6T) 284 Milliarden (284B)
Aktive Parameter/Token 49 Milliarden (49B) 13 Milliarden (13B)
Transformer-Schichten 61 43
Kontextfenster 1.000.000 Tokens 1.000.000 Tokens
Max. Output 384K Tokens 384K Tokens
Präzision FP4 (Experten) + FP8 (Rest) FP4 + FP8 gemischt
Pretraining 33T+ Tokens 32T+ Tokens
Lizenz MIT MIT

V4 verzichtet auf MLA aus V2/V3 zugunsten eines Hybrids aus Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA): CSA komprimiert die KV-Sequenz per Softmax-Gating 4×, nutzt einen FP4-„Lightning Indexer“ für top-k-Sparsity (Pro: top-1024, Flash: top-512) und behält ein 128-Token-Sliding-Window; HCA komprimiert 128× für globale Dense-Attention. Bei 1M Kontext: nur 27 % Inferenz-FLOPs gegenüber V3.2, KV-Cache-Speicher 10 % (Flash: 7 %).

Manifold-Constrained Hyper-Connections (mHC) stabilisieren 61 Schichten via 4-Kanal-Residualfluss und doppelt-stochastische Matrizen. Training mit Muon-Optimierer (Newton-Schulz-Orthogonalisierung) statt AdamW — schnellere, stabilere Konvergenz.

Drei Inferenzmodi
Modus Merkmale Einsatz
Non-think Keine Chain-of-Thought, minimale Latenz Einfache Q&A, Routing
Think High Explizites Reasoning (Thinking-Tags) Mittlere Komplexität, Code-Debug
Think Max Maximale Reasoning-Tiefe, 384K+ Kontext Mathematik, lange Agent-Ketten

Empfohlene Sampling-Parameter: temperature=1.0, top_p=1.0 (alle Modi).

SECTION 04 Benchmarks: SWE-bench 80,6 % und Kostenverhältnis 116×

V4-Pro — Kernbenchmarks
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % 96,0 % nicht separat veröffentlicht ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3.206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

SWE-bench Verified misst echte GitHub-Bugfixes — 80,6 % ist der Open-Source-Rekord, gleichauf mit Gemini 3.1 Pro. Laut Artificial Analysis kostet Claude Fable 5 im Strategy-&-Ops-Index $3,48 pro Lauf (50 Punkte), V4-Pro $0,03 (38 Punkte) — Fable 5 ist 116× teurer bei nur ~12 Punkten Vorsprung (~31 %).

SECTION 05 Vergleich GPT-5.6 / Claude Fable 5 und Spitzen-/Nebenzeiten-Tabelle

Drei Frontier-Modelle im Überblick
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open Source / Self-Host MIT Nein Nein
Kontextfenster 1M Tokens nicht offengelegt 1M Tokens
API-Output (Nebenzeit) $0,87/M ~$15/M $50/M
API-Output (Spitzenzeit) $1,74/M
Code-Fähigkeit Sehr stark (nahe Fable 5) Sehr stark Spitze
Datenschutz / DSGVO Private Deployment möglich Cloud-only Cloud-only

Szenario-Matrix: Budget / hohe Frequenz / Self-Host → V4-Pro oder V4-Flash; maximale Code-Qualität → Claude Fable 5; komplexe Mathematik → GPT-5.6 Sol/Ultra; Massen-Log-Analyse → V4-Flash (Cache-Hit-Input ab $0,0028/M). Kontext zu Kimi K3 (2,8T Open Source) hilft bei der Gesamt-LLM-Strategie.

Spitzen-/Nebenzeiten-Preise (Spitze: Werktags 09:00–12:00, 14:00–18:00 Peking, Faktor 2×)
Modell Position Nebenzeit (Off-Peak) Spitzenzeit (Peak)
V4-Pro Input (Cache-Hit) ¥0,025 / $0,0035 / 1M
V4-Pro Input (Cache-Miss) ¥3,00 / $0,435 / 1M ¥6,00 / $0,87 / 1M
V4-Pro Output ¥6,00 / $0,87 / 1M ¥12,00 / $1,74 / 1M
V4-Flash Input (Cache-Hit) ¥0,02 / $0,0028 / 1M
V4-Flash Input (Cache-Miss) ¥1,00 / $0,14 / 1M ¥2,00 / $0,28 / 1M
V4-Flash Output ¥2,00 / $0,28 / 1M ¥4,00 / $0,56 / 1M

Spartipps: Batch-Jobs nach 18:00 oder vor 09:00 legen; Prompt Cache für hohe Hit-Rate; einfaches Routing auf Flash, schwere Reasoning auf Pro. Selbst in Spitzenzeiten ist V4-Pro-Output $1,74/M — 8,6× günstiger als Claude Opus 4.8 ($15/M).

SECTION 06 API-Migration bis 24. Juli: sechs Schritte und Python-Beispiel

Warnung: deepseek-chat und deepseek-reasoner enden am 24. Juli 2026, 15:59 UTC (23:59 Peking) dauerhaft.

Migrations-Mapping
Altes Modell Neues Modell Hinweis
deepseek-chat deepseek-v4-flash (Non-think) Schnell, leichte Aufgaben
deepseek-reasoner deepseek-v4-flash (Think-Modus) oder Upgrade auf deepseek-v4-pro
  1. Codebase durchsuchen: Repos, CI und Umgebungsvariablen auf deepseek-chat / deepseek-reasoner prüfen.
  2. Zielmodell wählen: Leichte Dialoge → deepseek-v4-flash; komplexes Reasoning → deepseek-v4-pro.
  3. OpenAI SDK anpassen: Nur model ändern, base_url=https://api.deepseek.com beibehalten.
  4. Thinking-Modus (optional): Via extra_body aktivieren — ersetzt deepseek-reasoner.
  5. Staging-Lasttest: Latenz, Token-Abrechnung und Spitzen-/Nebenzeiten-Rechnung validieren.
  6. Grauzonen-Rollout vor 24.07.: Produktion umschalten, Fehlerrate überwachen; DeepSeek kündigt Preisänderungen 24 h per E-Mail an.
deepseek_v4_migration.py
from openai import OpenAI

client = OpenAI(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Analysiere diesen Swift-Code auf Performance-Engpässe..."}],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 unterstützt OpenAI ChatCompletions und Anthropic Messages; bei Anthropic SDK bleibt base_url unverändert, model auf deepseek-v4-pro setzen.

SECTION 07 Zitierbare Kennzahlen, Quellen und Infrastruktur-Empfehlung

  • KV-Cache: Bei 1M Kontext nur 10 % Speicher vs. V3.2 (Flash: 7 %)
  • Inferenz-FLOPs: 27 % gegenüber V3.2 bei 1M Szenario
  • Kostenverhältnis: V4-Pro $0,03 vs. Fable 5 $3,48 pro Task — Faktor 116
  • Spitzenzeit: Output $1,74/M = 1/8,6 von Opus 4.8
  • Migrationsfrist: 2026-07-24 23:59 Peking
  • Sampling: temperature=1.0, top_p=1.0

Offizielle und unabhängige Quellen — nach Updates erneut prüfen:

DeepSeek API — offizielle Dokumentation

arXiv:2606.19348 — DeepSeek V4 Technikpaper

Artificial Analysis — Modell-Kostenvergleich

DeepSeek V4 GA ist 2026 der wichtigste Open-Source-Meilenstein — nicht weil es Claude Fable 5 oder GPT-5.6 schlägt, sondern weil es Spitzenleistung zu Bruchteilskosten liefert. Doch Cloud-LLMs ersetzen weder Xcode-Builds noch Metal-Debug noch iOS-Zertifikatsketten; virtualisiertes macOS birgt EULA-Risiken und 20–40 % Verlust. Bewährtes Setup: V4-API für Langkontext und Agent-Orchestrierung, VPSNIX M4/M4-Pro-Physikknoten für native Kompilierung und 7×24-Agenten — 100 % Original-Hardware, voller Root-Zugriff, null Hypervisor-Overhead. Preise auf der Preisseite; wer den Kimi-K3-Vergleich gelesen hat, sollte Compute in complianten Physikumgebungen verankern statt auf einen einzelnen API-Anbieter zu setzen.

SECTION 08 FAQ

Was unterscheidet GA von der Preview?

Gleiche Architektur; GA verbessert Agent, Mathematik und Code, führt Spitzen-/Nebenzeiten ein. Alte Endpunkte enden am 24. Juli.

Wann gilt der Spitzenpreis?

Werktags 09:00–12:00 und 14:00–18:00 Peking — Faktor 2×; außerhalb Nebenzeitpreise.

V4-Pro oder V4-Flash?

Flash für leichtes Routing und hohe Frequenz (Output $0,28/M); Pro für komplexes Reasoning und Code (Output $0,87/M, SWE-bench 80,6 %).

Self-Hosting unter DSGVO?

Ja — MIT-Lizenz erlaubt private Deployment; 1,6T erfordert großes GPU-Cluster. Für EU-Prompts oft wirtschaftlicher als reine Cloud-API mit Drittlandtransfer.