Startseite / Blog / V4 Flash
ENGINEERING_BLOG · 2026.08.05

DeepSeek V4 Flash offiziell: TerminalBench 82,7 bei Preis 1/100 von Claude Opus

V4-FLASH-0731 · TerminalBench 2.0
82.7

284B gesamt / 13B aktiv · Input $0,14/$0,0028 pro M · Output $0,28 · Harness minimal mode (vendor-run)

Wer im August 2026 Agent-Pipelines oder Batch-Inferenz über DeepSeek betreibt, steht vor einem Paradox: DeepSeek-V4-Flash-0731 liefert laut Anbieter TerminalBench 2.0 mit 82,7 Punkten — mehr als das größere V4-Pro-Preview (67,9) — bei einem Listenpreis von $0,14 Input ohne Cache / $0,0028 mit Cache und $0,28 Output pro Million Tokens. Gleichzeitig ist die Architektur identisch zur April-Preview: 284B Gesamtparameter, 13B aktiv, nur das Post-Training wurde neu durchlaufen. Dieser datengetriebene Leitfaden liefert Zeitstrahl, Preis- und Benchmark-Matrizen gegen Kimi K3 und Qwen3.8-Max, DSGVO-Hinweise für Cloud-Prompts, die Harness-Abhängigkeit der Agent-Scores und sechs Schritte vor der API-Migration.

SECTION 01 Fünf Evaluationsrisiken bei V4-Flash-0731 (Stand 5. August 2026)

Die offizielle Flash-Version ist kein neues Modell, sondern ein Re-Post-Training auf gleicher Architektur — ein Detail, das in Marketing-Headlines leicht untergeht. Für EU-Teams mit dokumentationspflichtigen Beschaffungsprozessen zählen diese fünf Punkte:

  • Harness-abhängige Agent-Scores: TerminalBench 2.0 (82,7) und Toolathlon wurden mit dem noch nicht veröffentlichten DeepSeek Harness im Minimal-Modus gemessen — max Reasoning, top_p 0,95, temperature 1,0. DeepSeek warnt selbst: Agent-Benchmarks sind extrem sensitiv zur Harness-Wahl. Bis Community-Reproduktion mit Claude Code oder Cursor erfolgt, sind diese Werte „Vendor plus Framework“, nicht universelle Fähigkeitsclaims.
  • V4-Pro GA und Harness fehlen: Die Flaggschiff-Version und das erste hauseigene Agent-Framework sind laut Changelog „bald verfügbar“ — ohne bestätigtes Datum. Medienberichte über GA zwischen 10.–20. August stammen aus nicht bestätigten Quellen.
  • Nur API, kein App-Update: Der 31.07.-Release betrifft ausschließlich die API. Consumer-App und Web-Chat blieben auf dem alten Stand — Produktions-Teams dürfen nicht App-Verhalten mit API-Performance gleichsetzen.
  • Praxis-Feedback vs. Benchmark-Narrativ: Entwickler-Communities berichten niedrige Input-Cache-Hit-Raten und gelegentliche Safety-Classifer-Timeouts — Hinweise, dass Compute-Budget und Infrastruktur weiterhin Grenzen setzen, unabhängig von Post-Training-Gewinnen.
  • DSGVO bei Cloud-Agent-Loops: Personenbezogene Inhalte über die DeepSeek-API erfordern AVV, Transferimpact Assessment und Pseudonymisierung. Die extreme Preisvorteil gegen Claude ($0,14 vs. ~$5 Input ohne Cache) lockt zu riskanten Workflows — Compliance darf nicht dem Kostendruck folgen.

SECTION 02 Zeitstrahl April–August und harte Preis-Specs

DeepSeek V4 — Meilensteine bis Stichtag 5.08.2026
Datum Ereignis
2026-04-24 V4-Preview + MIT Open Weights: V4-Pro (1,6T/49B) und V4-Flash (284B/13B), 1M Kontext
2026-07-24 Legacy-Aliase deepseek-chat und deepseek-reasoner offiziell deaktiviert
2026-07-27 Moonshot veröffentlicht Kimi K3 Open Weights (2,8T) — Wettbewerbsdruck kurz vor Flash-Update
2026-07-31 V4-Flash-0731 offiziell: API-Beta, HF-Gewichte, erster Harness-Hinweis im Changelog
2026-08-05 V4-Pro offizielle Version weiter ausstehend; Harness nicht öffentlich
Preis- und Architektur-Matrix (Anbieter-Listpreise)
Modell Status Gesamt / aktiv Input ($/M, miss/hit) Output ($/M)
V4-Flash-0731 Offiziell (31.07.) 284B / 13B $0,14 / $0,0028 $0,28
V4-Pro Preview (04.24.) 1,6T / 49B $0,435 / $0,003625 $0,87
Kimi K3 Gewichte 27.07. 2,8T / ~104B (Schätzung) $3,00 / $0,30 $15,00
Qwen3.8-Max API GA 03.08. 2,4T / 95B $2,00 / ~$0,17–0,25 $6,00
GLM-5.2 Open (Juni 2026) ~744B / ~40B Nicht in diesem Review verifiziert Nicht verifiziert

284B Flash schlägt 1,6T Pro auf Agent-Benchmarks — ein Signal, dass Post-Training 2026 fast so wichtig wird wie Parameterzahl. Der Preisvorteil gegen Claude Opus 4.8 liegt bei etwa 36× (Cache-Miss Input) bis 179× (Cache-Hit Input).

SECTION 03 Entscheidungsmatrix: Intelligence Index vs. Kosten pro Task

Artificial Analysis liefert unabhängige Vergleichsdaten — getrennt von DeepSeek-eigenen Agent-Scores. Die Tabelle zeigt den zentralen Trade-off: V4-Flash ist nicht der intelligenteste Modell in China, aber der günstigste pro Task.

Artificial Analysis — Intelligence Index und Task-Kosten (August 2026)
Modell Intelligence Index Kosten pro Task Quelle
V4-Flash-0731 50 $0,03 Artificial Analysis (Drittanbieter)
Kimi K3 57 $0,86 Artificial Analysis
GLM-5.2 ~1 Punkt über Flash Nicht verifiziert Artificial Analysis (teilweise)
GPT-5.6 Sol 9+ Punkte über Flash $1,86 Artificial Analysis
Claude Fable 5 9+ Punkte über Flash $3,15 Artificial Analysis
V4-Flash vs. K3 7 Punkte weniger ~1/29 der K3-Task-Kosten Kosten-Effizienz-Fokus DeepSeek

Vertiefung: DeepSeek V4 GA-Analyse, OpenRouter Juli-Rankings (V4-Flash sieben Wochen #1 bei Aufrufen), GPT-5.6 Luna −80 % als Reaktion auf den Preiskrieg.

SECTION 04 DSA-Architektur, Post-Training und Harness — technische Einordnung

DeepSeeks Technikbericht DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence beschreibt drei Architekturänderungen, die seit der April-Preview gelten — unabhängig vom 31.07.-Post-Training-Update:

  • Hybrid-Attention (DSA): Compressed Sparse Attention (CSA) plus Heavily Compressed Attention (HCA) reduzieren Compute und KV-Cache bei 1M Kontext. Anbieter-Claim: V4-Pro benötigt bei 1M Tokens nur 27 % der FLOPs und 10 % KV-Cache von V3.2 — noch ohne unabhängige Reproduktion.
  • mHC (Manifold-Constrained Hyper-Connections): Verbesserte Residual-Struktur für stabilere Gradientenflüsse im Training.
  • Muon-Optimierer: Ersetzt klassische Optimizer für schnellere Konvergenz — relevant für Teams, die Fine-Tuning auf MIT-Gewichten planen.

DeepSeek Harness — erstmals im 31.07.-Changelog genannt — ist das hauseigene Agent-Framework für Datei-I/O, Tool-Calls und End-to-End-Engineering-Tasks, positioniert als Alternative zu Claude Code. Alle veröffentlichten Agent-Benchmarks für Flash-0731 laufen über Harness Minimal Mode. Für Produktions-Teams bedeutet das: API-Qualität in Cursor oder OpenCode kann deutlich abweichen.

Vendor-run Agent-Benchmarks (Harness minimal mode)
Benchmark V4-Flash-0731 V4-Pro Preview Hinweis
TerminalBench 2.0 82,7 67,9 Vendor-run, Harness-abhängig
SWE-bench Verified In Changelog referenziert Breiter akzeptiert als Agent-Bench
Toolathlon In Changelog referenziert Harness minimal mode

SECTION 05 Sechs Schritte vor Migration, zitierbare Daten und Produktions-Einordnung

  1. Legacy-Endpunkte auditieren: Suche im Code und CI für deepseek-chat und deepseek-reasoner — seit 24.07. deaktiviert. deepseek-v4-flash zeigt automatisch auf 0731.
  2. Cache-Hit-Rate monitoren: Niedrige Hit-Raten treiben Input-Kosten von $0,0028 auf $0,14 pro M — in Agent-Loops mit voller History kritisch. Logging pro Request einplanen.
  3. Peak-Hour-Zuschlag vormerken: DeepSeek kündigt 2× Preise werktags 9–12 und 14–18 Uhr Beijing an — noch ohne festes Startdatum. Scheduler für Batch-Jobs vorbereiten.
  4. Benchmark-Quellen trennen: Artificial Analysis (Intelligence Index 50, $0,03/Task) von Harness-TerminalBench (82,7) in Evaluations-Tabellen splitten — unterschiedliche Methodik.
  5. A/B gegen K3 und Qwen: Gleiche Prompt-Sets auf Code, Langdokumente und Agent-Tasks — K3 hat Gewichte, Qwen nur API: Bedingungen im Report explizit machen.
  6. Harness-Release tracken: Bis DeepSeek Harness öffentlich ist, interne Agent-Scores mit „Framework-unbekannt“ taggen — keine SLA-Zusagen an Stakeholder.
  7. Build-Schicht separieren: Kein LLM signiert in Xcode — M4-Cloud-Physik für iOS CI/CD parallel zu API-Inferenz planen.
  • Architektur: 284B gesamt / 13B aktiv MoE, 1M Kontext, MIT-Lizenz
  • Preis vs. Claude Opus 4.8: ~36× günstiger Input Cache-Miss, ~179× Cache-Hit, ~89× Output (Medienangaben)
  • Effizienz-Claim: 27 % FLOPs / 10 % KV-Cache vs. V3.2 bei 1M Kontext (vendor-run)
  • OpenRouter: V4-Flash Preview sieben Wochen #1 bei Token-Aufrufen vor 31.07.
  • Finanzierung (Hintergrund, nicht verifiziert): Medien berichten ~7,4 Mrd. $ Round, Bewertung ~48,7 Mrd. $ — keine offizielle Bestätigung

Primärquellen — nach Updates erneut prüfen:

DeepSeek API — Dokumentation und Changelog

Hugging Face — deepseek-ai/DeepSeek-V4-Flash

Artificial Analysis — Intelligence Index und Task-Kosten

V4-Flash-0731 ist kein Marketing-Gimmick, aber auch kein universeller Champion: Harness-abhängige Scores, fehlendes V4-Pro GA, API-only-Release und DSGVO-Cloud-Risiken bremsen sofortige EU-Vollrollouts. Praxisnahes Setup: DeepSeek API für kosteneffiziente Agent-Inferenz, VPSNIX M4/M4-Pro-Physikknoten für native Apple-Silicon-Builds — 100 % Original-Hardware, voller Root, null Hypervisor-Overhead. Virtuelle Mac-Instanzen leiden unter Hypervisor-Verlust, inkonsistenter Metal-Performance und instabiler Xcode-Signierung — für 7×24 Agent-Pipelines ungeeignet. Preise prüfen und Inferenz plus Compile auf getrennten, stabilen Schichten verankern.

SECTION 06 FAQ

Was unterscheidet V4 Flash von V3.2?

Nativ 1M Token Kontext mit drastisch reduziertem Compute (27 % FLOPs, 10 % KV-Cache laut Anbieter). Agent-Optimierung für Claude Code, OpenCode und das kommende Harness-Framework. Post-Training-Fokus statt Parameter-Wachstum.

Flash oder Pro für den Alltag?

Für Dialog, Batch-Tasks und kostensensitive Agent-Pipelines: V4-Flash-0731 — höhere Agent-Scores als Pro-Preview bei Bruchteil des Preises. Für komplexe Reasoning mit hohem Budget: Pro-Preview bis GA abwarten.

Ist V4-Pro offiziell verfügbar?

Nein — Stand 5. August 2026 nur Flash-0731 offiziell, API-only. Pro GA und Harness: Changelog sagt „bald“, ohne Datum. August-10–20-Medienberichte sind nicht bestätigt.

Kann ich DeepSeek-Benchmarks blind vertrauen?

SWE-bench Verified hat breitere Akzeptanz. TerminalBench und Toolathlon sind Harness-abhängig und vendor-run — DeepSeek warnt selbst vor Framework-Sensitivität. Warten auf Community-Reproduktion mit anderen Agent-Tools.

Muss ich Code ändern nach dem Update?

Wer bereits deepseek-v4-flash nutzt: automatisches Upgrade auf 0731. Wer noch deepseek-chat oder deepseek-reasoner aufruft: sofort migrieren — Endpunkte seit 24.07. deaktiviert.

Was ist DeepSeek Harness?

Erstes hauseigenes Agent-Ausführungsframework — Dateien, Tools, Multi-Step-Engineering. Positioniert als Claude-Code-Alternative. Im Changelog 31.07. erstmals genannt, noch nicht öffentlich verfügbar.