Wer im August 2026 Agent-Pipelines oder Batch-Inferenz über DeepSeek betreibt, steht vor einem Paradox: DeepSeek-V4-Flash-0731 liefert laut Anbieter TerminalBench 2.0 mit 82,7 Punkten — mehr als das größere V4-Pro-Preview (67,9) — bei einem Listenpreis von $0,14 Input ohne Cache / $0,0028 mit Cache und $0,28 Output pro Million Tokens. Gleichzeitig ist die Architektur identisch zur April-Preview: 284B Gesamtparameter, 13B aktiv, nur das Post-Training wurde neu durchlaufen. Dieser datengetriebene Leitfaden liefert Zeitstrahl, Preis- und Benchmark-Matrizen gegen Kimi K3 und Qwen3.8-Max, DSGVO-Hinweise für Cloud-Prompts, die Harness-Abhängigkeit der Agent-Scores und sechs Schritte vor der API-Migration.
SECTION 01 Fünf Evaluationsrisiken bei V4-Flash-0731 (Stand 5. August 2026)
Die offizielle Flash-Version ist kein neues Modell, sondern ein Re-Post-Training auf gleicher Architektur — ein Detail, das in Marketing-Headlines leicht untergeht. Für EU-Teams mit dokumentationspflichtigen Beschaffungsprozessen zählen diese fünf Punkte:
- Harness-abhängige Agent-Scores: TerminalBench 2.0 (82,7) und Toolathlon wurden mit dem noch nicht veröffentlichten DeepSeek Harness im Minimal-Modus gemessen — max Reasoning, top_p 0,95, temperature 1,0. DeepSeek warnt selbst: Agent-Benchmarks sind extrem sensitiv zur Harness-Wahl. Bis Community-Reproduktion mit Claude Code oder Cursor erfolgt, sind diese Werte „Vendor plus Framework“, nicht universelle Fähigkeitsclaims.
- V4-Pro GA und Harness fehlen: Die Flaggschiff-Version und das erste hauseigene Agent-Framework sind laut Changelog „bald verfügbar“ — ohne bestätigtes Datum. Medienberichte über GA zwischen 10.–20. August stammen aus nicht bestätigten Quellen.
- Nur API, kein App-Update: Der 31.07.-Release betrifft ausschließlich die API. Consumer-App und Web-Chat blieben auf dem alten Stand — Produktions-Teams dürfen nicht App-Verhalten mit API-Performance gleichsetzen.
- Praxis-Feedback vs. Benchmark-Narrativ: Entwickler-Communities berichten niedrige Input-Cache-Hit-Raten und gelegentliche Safety-Classifer-Timeouts — Hinweise, dass Compute-Budget und Infrastruktur weiterhin Grenzen setzen, unabhängig von Post-Training-Gewinnen.
- DSGVO bei Cloud-Agent-Loops: Personenbezogene Inhalte über die DeepSeek-API erfordern AVV, Transferimpact Assessment und Pseudonymisierung. Die extreme Preisvorteil gegen Claude ($0,14 vs. ~$5 Input ohne Cache) lockt zu riskanten Workflows — Compliance darf nicht dem Kostendruck folgen.
SECTION 02 Zeitstrahl April–August und harte Preis-Specs
| Datum | Ereignis |
|---|---|
| 2026-04-24 | V4-Preview + MIT Open Weights: V4-Pro (1,6T/49B) und V4-Flash (284B/13B), 1M Kontext |
| 2026-07-24 | Legacy-Aliase deepseek-chat und deepseek-reasoner offiziell deaktiviert |
| 2026-07-27 | Moonshot veröffentlicht Kimi K3 Open Weights (2,8T) — Wettbewerbsdruck kurz vor Flash-Update |
| 2026-07-31 | V4-Flash-0731 offiziell: API-Beta, HF-Gewichte, erster Harness-Hinweis im Changelog |
| 2026-08-05 | V4-Pro offizielle Version weiter ausstehend; Harness nicht öffentlich |
| Modell | Status | Gesamt / aktiv | Input ($/M, miss/hit) | Output ($/M) |
|---|---|---|---|---|
| V4-Flash-0731 | Offiziell (31.07.) | 284B / 13B | $0,14 / $0,0028 | $0,28 |
| V4-Pro | Preview (04.24.) | 1,6T / 49B | $0,435 / $0,003625 | $0,87 |
| Kimi K3 | Gewichte 27.07. | 2,8T / ~104B (Schätzung) | $3,00 / $0,30 | $15,00 |
| Qwen3.8-Max | API GA 03.08. | 2,4T / 95B | $2,00 / ~$0,17–0,25 | $6,00 |
| GLM-5.2 | Open (Juni 2026) | ~744B / ~40B | Nicht in diesem Review verifiziert | Nicht verifiziert |
284B Flash schlägt 1,6T Pro auf Agent-Benchmarks — ein Signal, dass Post-Training 2026 fast so wichtig wird wie Parameterzahl. Der Preisvorteil gegen Claude Opus 4.8 liegt bei etwa 36× (Cache-Miss Input) bis 179× (Cache-Hit Input).
SECTION 03 Entscheidungsmatrix: Intelligence Index vs. Kosten pro Task
Artificial Analysis liefert unabhängige Vergleichsdaten — getrennt von DeepSeek-eigenen Agent-Scores. Die Tabelle zeigt den zentralen Trade-off: V4-Flash ist nicht der intelligenteste Modell in China, aber der günstigste pro Task.
| Modell | Intelligence Index | Kosten pro Task | Quelle |
|---|---|---|---|
| V4-Flash-0731 | 50 | $0,03 | Artificial Analysis (Drittanbieter) |
| Kimi K3 | 57 | $0,86 | Artificial Analysis |
| GLM-5.2 | ~1 Punkt über Flash | Nicht verifiziert | Artificial Analysis (teilweise) |
| GPT-5.6 Sol | 9+ Punkte über Flash | $1,86 | Artificial Analysis |
| Claude Fable 5 | 9+ Punkte über Flash | $3,15 | Artificial Analysis |
| V4-Flash vs. K3 | 7 Punkte weniger | ~1/29 der K3-Task-Kosten | Kosten-Effizienz-Fokus DeepSeek |
Vertiefung: DeepSeek V4 GA-Analyse, OpenRouter Juli-Rankings (V4-Flash sieben Wochen #1 bei Aufrufen), GPT-5.6 Luna −80 % als Reaktion auf den Preiskrieg.
SECTION 04 DSA-Architektur, Post-Training und Harness — technische Einordnung
DeepSeeks Technikbericht DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence beschreibt drei Architekturänderungen, die seit der April-Preview gelten — unabhängig vom 31.07.-Post-Training-Update:
- Hybrid-Attention (DSA): Compressed Sparse Attention (CSA) plus Heavily Compressed Attention (HCA) reduzieren Compute und KV-Cache bei 1M Kontext. Anbieter-Claim: V4-Pro benötigt bei 1M Tokens nur 27 % der FLOPs und 10 % KV-Cache von V3.2 — noch ohne unabhängige Reproduktion.
- mHC (Manifold-Constrained Hyper-Connections): Verbesserte Residual-Struktur für stabilere Gradientenflüsse im Training.
- Muon-Optimierer: Ersetzt klassische Optimizer für schnellere Konvergenz — relevant für Teams, die Fine-Tuning auf MIT-Gewichten planen.
DeepSeek Harness — erstmals im 31.07.-Changelog genannt — ist das hauseigene Agent-Framework für Datei-I/O, Tool-Calls und End-to-End-Engineering-Tasks, positioniert als Alternative zu Claude Code. Alle veröffentlichten Agent-Benchmarks für Flash-0731 laufen über Harness Minimal Mode. Für Produktions-Teams bedeutet das: API-Qualität in Cursor oder OpenCode kann deutlich abweichen.
| Benchmark | V4-Flash-0731 | V4-Pro Preview | Hinweis |
|---|---|---|---|
| TerminalBench 2.0 | 82,7 | 67,9 | Vendor-run, Harness-abhängig |
| SWE-bench Verified | In Changelog referenziert | — | Breiter akzeptiert als Agent-Bench |
| Toolathlon | In Changelog referenziert | — | Harness minimal mode |
SECTION 05 Sechs Schritte vor Migration, zitierbare Daten und Produktions-Einordnung
- Legacy-Endpunkte auditieren: Suche im Code und CI für
deepseek-chatunddeepseek-reasoner— seit 24.07. deaktiviert.deepseek-v4-flashzeigt automatisch auf 0731. - Cache-Hit-Rate monitoren: Niedrige Hit-Raten treiben Input-Kosten von $0,0028 auf $0,14 pro M — in Agent-Loops mit voller History kritisch. Logging pro Request einplanen.
- Peak-Hour-Zuschlag vormerken: DeepSeek kündigt 2× Preise werktags 9–12 und 14–18 Uhr Beijing an — noch ohne festes Startdatum. Scheduler für Batch-Jobs vorbereiten.
- Benchmark-Quellen trennen: Artificial Analysis (Intelligence Index 50, $0,03/Task) von Harness-TerminalBench (82,7) in Evaluations-Tabellen splitten — unterschiedliche Methodik.
- A/B gegen K3 und Qwen: Gleiche Prompt-Sets auf Code, Langdokumente und Agent-Tasks — K3 hat Gewichte, Qwen nur API: Bedingungen im Report explizit machen.
- Harness-Release tracken: Bis DeepSeek Harness öffentlich ist, interne Agent-Scores mit „Framework-unbekannt“ taggen — keine SLA-Zusagen an Stakeholder.
- Build-Schicht separieren: Kein LLM signiert in Xcode — M4-Cloud-Physik für iOS CI/CD parallel zu API-Inferenz planen.
- Architektur: 284B gesamt / 13B aktiv MoE, 1M Kontext, MIT-Lizenz
- Preis vs. Claude Opus 4.8: ~36× günstiger Input Cache-Miss, ~179× Cache-Hit, ~89× Output (Medienangaben)
- Effizienz-Claim: 27 % FLOPs / 10 % KV-Cache vs. V3.2 bei 1M Kontext (vendor-run)
- OpenRouter: V4-Flash Preview sieben Wochen #1 bei Token-Aufrufen vor 31.07.
- Finanzierung (Hintergrund, nicht verifiziert): Medien berichten ~7,4 Mrd. $ Round, Bewertung ~48,7 Mrd. $ — keine offizielle Bestätigung
Primärquellen — nach Updates erneut prüfen:
DeepSeek API — Dokumentation und Changelog
Hugging Face — deepseek-ai/DeepSeek-V4-Flash
Artificial Analysis — Intelligence Index und Task-Kosten
V4-Flash-0731 ist kein Marketing-Gimmick, aber auch kein universeller Champion: Harness-abhängige Scores, fehlendes V4-Pro GA, API-only-Release und DSGVO-Cloud-Risiken bremsen sofortige EU-Vollrollouts. Praxisnahes Setup: DeepSeek API für kosteneffiziente Agent-Inferenz, VPSNIX M4/M4-Pro-Physikknoten für native Apple-Silicon-Builds — 100 % Original-Hardware, voller Root, null Hypervisor-Overhead. Virtuelle Mac-Instanzen leiden unter Hypervisor-Verlust, inkonsistenter Metal-Performance und instabiler Xcode-Signierung — für 7×24 Agent-Pipelines ungeeignet. Preise prüfen und Inferenz plus Compile auf getrennten, stabilen Schichten verankern.
SECTION 06 FAQ
Was unterscheidet V4 Flash von V3.2?
Nativ 1M Token Kontext mit drastisch reduziertem Compute (27 % FLOPs, 10 % KV-Cache laut Anbieter). Agent-Optimierung für Claude Code, OpenCode und das kommende Harness-Framework. Post-Training-Fokus statt Parameter-Wachstum.
Flash oder Pro für den Alltag?
Für Dialog, Batch-Tasks und kostensensitive Agent-Pipelines: V4-Flash-0731 — höhere Agent-Scores als Pro-Preview bei Bruchteil des Preises. Für komplexe Reasoning mit hohem Budget: Pro-Preview bis GA abwarten.
Ist V4-Pro offiziell verfügbar?
Nein — Stand 5. August 2026 nur Flash-0731 offiziell, API-only. Pro GA und Harness: Changelog sagt „bald“, ohne Datum. August-10–20-Medienberichte sind nicht bestätigt.
Kann ich DeepSeek-Benchmarks blind vertrauen?
SWE-bench Verified hat breitere Akzeptanz. TerminalBench und Toolathlon sind Harness-abhängig und vendor-run — DeepSeek warnt selbst vor Framework-Sensitivität. Warten auf Community-Reproduktion mit anderen Agent-Tools.
Muss ich Code ändern nach dem Update?
Wer bereits deepseek-v4-flash nutzt: automatisches Upgrade auf 0731. Wer noch deepseek-chat oder deepseek-reasoner aufruft: sofort migrieren — Endpunkte seit 24.07. deaktiviert.
Was ist DeepSeek Harness?
Erstes hauseigenes Agent-Ausführungsframework — Dateien, Tools, Multi-Step-Engineering. Positioniert als Claude-Code-Alternative. Im Changelog 31.07. erstmals genannt, noch nicht öffentlich verfügbar.