Le 31 juillet 2026, DeepSeek a franchi une étape discrète mais structurante : la promotion officielle de V4-Flash-0731 en bêta API publique. Même architecture qu'en avril — 284 milliards de paramètres totaux, 13 milliards activés — mais un post-training entièrement repassé. Résultat annoncé : TerminalBench 2.0 à 82,7, supérieur au preview V4-Pro (67,9), pour un tarif d'entrée de 0,14 $ sans cache et 0,0028 $ avec cache par million de tokens. Le flagship V4-Pro et le framework agent Harness restent en attente. Ce dossier s'adresse aux architectes qui arbitrent entre Kimi K3, Qwen3.8-Max et les modèles fermés — avec chronologie, matrices de prix, limites des benchmarks Harness et six étapes avant migration API.
SECTION 01 Pourquoi les benchmarks officiels ne racontent pas toute l'histoire
L'été 2026 concentre les lancements chinois : Kimi K3 open weights le 27 juillet, Qwen3.8-Max GA le 3 août, et DeepSeek V4 Flash officiel entre les deux. Cinq tensions méritent une lecture professionnelle avant toute décision d'achat :
- Scores agent dépendants du Harness : TerminalBench 2.0 (82,7) et Toolathlon ont été mesurés avec le DeepSeek Harness en mode minimal — framework maison encore non publié, paramètres max, top_p 0,95, temperature 1,0. DeepSeek prévient explicitement que le choix de harness influence massivement les scores. Jusqu'à reproduction par des tiers avec Claude Code ou Cursor, traiter ces chiffres comme « éditeur plus framework », pas comme capacité portable.
- V4-Pro GA et Harness : calendrier flou : Le changelog promet une sortie « prochaine » sans date. Les médias chinois évoquent un GA entre 10 et 20 août sur sources non nommées — non confirmé par DeepSeek.
- API seule, pas l'app grand public : Le 31 juillet, seule l'API a été mise à jour. L'application et le chat web restent sur l'ancienne version — ne pas extrapoler l'expérience utilisateur depuis les scores API.
- Retours terrain vs. narrative marketing : Des développeurs signalent un faible taux de cache-hit en entrée et des timeouts occasionnels du classificateur de sécurité — rappel que le budget compute limite encore les gains du post-training seul.
- La « ligne de rupture » du marché chinois : Dans les forums, le terme 斩杀线 (ligne de rupture) décrit le seuil que DeepSeek impose : performance suffisante à prix imbattable. Cela explique la baisse de 80 % sur GPT-5.6 Luna et la course concurrentielle documentée dans notre analyse GPT-5.6 Luna.
SECTION 02 Chronologie avril–août et grille tarifaire consolidée
| Date | Événement |
|---|---|
| 24 avril 2026 | Preview V4 + poids MIT : V4-Pro (1,6T/49B) et V4-Flash (284B/13B), contexte 1M |
| 24 juillet 2026 | Alias legacy deepseek-chat et deepseek-reasoner retirés |
| 27 juillet 2026 | Kimi K3 open weights (2,8T) — pression concurrentielle immédiate |
| 31 juillet 2026 | V4-Flash-0731 officiel : API bêta, HF, première mention Harness dans le changelog |
| 5 août 2026 | V4-Pro GA et Harness toujours en attente |
| Modèle | Statut | Total / actifs | Entrée (miss/hit) | Sortie |
|---|---|---|---|---|
| V4-Flash-0731 | Officiel | 284B / 13B | 0,14 $ / 0,0028 $ | 0,28 $ |
| V4-Pro | Preview | 1,6T / 49B | 0,435 $ / 0,003625 $ | 0,87 $ |
| Kimi K3 | Poids 27/07 | 2,8T / ~104B (est.) | 3,00 $ / 0,30 $ | 15,00 $ |
| Qwen3.8-Max | API GA 03/08 | 2,4T / 95B | 2,00 $ / ~0,17–0,25 $ | 6,00 $ |
| GLM-5.2 | Open (juin 2026) | ~744B / ~40B | Non vérifié ici | Non vérifié |
DeepSeek ne vise pas le premier rang absolu sur l'Intelligence Index — il optimise « intelligence suffisante à un prix que personne ne peut égaler ». Le preview V4-Flash a tenu la première place OpenRouter en volume d'appels pendant sept semaines consécutives.
SECTION 03 Arbitrage stratégique : intelligence vs. coût par tâche
Artificial Analysis fournit des données tierces distinctes des benchmarks agent DeepSeek. Le tableau révèle le paradoxe central : V4-Flash n'est pas le modèle le plus intelligent en Chine, mais le moins cher par tâche.
| Modèle | Intelligence Index | Coût par tâche | Provenance |
|---|---|---|---|
| V4-Flash-0731 | 50 | 0,03 $ | Tiers indépendant |
| Kimi K3 | 57 | 0,86 $ | Tiers indépendant |
| GLM-5.2 | ~1 pt au-dessus de Flash | Non vérifié | Partiel |
| GPT-5.6 Sol | 9+ pts au-dessus | 1,86 $ | Tiers indépendant |
| Claude Fable 5 | 9+ pts au-dessus | 3,15 $ | Tiers indépendant |
| Ratio Flash vs. K3 | −7 points | ~1/29 du coût K3 | Stratégie coût-efficacité |
Pour le contexte V4 complet : analyse DeepSeek V4 GA et classements OpenRouter juillet.
SECTION 04 Architecture DSA, post-training et le framework Harness
Le rapport technique DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence décrit trois innovations architecturales portées depuis la preview d'avril — indépendantes du repost-training du 31 juillet :
- Attention hybride DSA : CSA (Compressed Sparse Attention) et HCA (Heavily Compressed Attention) réduisent compute et KV-cache à 1M tokens. Claim éditeur : 27 % des FLOPs et 10 % du KV-cache de V3.2 — pas encore reproduit indépendamment.
- mHC : hyper-connexions contraintes sur manifold pour des résidus plus stables.
- Optimiseur Muon : convergence accélérée — pertinent pour les équipes creative qui fine-tunent sur Apple Silicon avec des workflows Metal adjacents.
DeepSeek Harness, mentionné pour la première fois le 31 juillet, est le framework agent maison pour I/O fichiers, appels d'outils et tâches d'ingénierie multi-étapes — alternative interne à Claude Code. Tous les scores agent publiés pour Flash-0731 transitent par le mode minimal de ce framework. Pour les studios qui couplent inférence cloud et builds natifs sur Mac, la qualité en production peut diverger significativement.
| Benchmark | V4-Flash-0731 | V4-Pro preview | Note |
|---|---|---|---|
| TerminalBench 2.0 | 82,7 | 67,9 | Vendor-run, harness-dépendant |
| SWE-bench Verified | Référencé changelog | — | Méthodologie plus transparente |
| Toolathlon | Référencé changelog | — | Harness minimal mode |
SECTION 05 Checklist en six étapes, données citables et architecture recommandée
- Audit des endpoints legacy : traquer
deepseek-chatetdeepseek-reasoner— retirés le 24 juillet.deepseek-v4-flashpointe automatiquement vers 0731. - Monitorer le cache-hit : un hit faible fait sauter l'entrée de 0,0028 $ à 0,14 $ par million — critique en boucles agent avec historique complet.
- Anticiper la surcharge heures de pointe : DeepSeek annonce un doublement werktags 9–12h et 14–18h Beijing — date d'effet non confirmée. Planifier les batchs hors pic.
- Séparer les sources de preuve : Intelligence Index (50, 0,03 $/tâche) vs. TerminalBench Harness (82,7) dans des tableaux distincts.
- A/B structuré : mêmes prompts contre K3 (poids locaux) et Qwen (API seule) — asymétrie documentée dans le rapport.
- Tracker Harness GA : taguer les scores internes « framework inconnu » jusqu'à publication — pas de SLA exécutif prématuré.
- Séparer inférence et compilation : aucun LLM signe dans Xcode — prévoir nœuds M4 cloud pour CI/CD iOS en parallèle.
- Architecture : MoE 284B / 13B actifs, contexte 1M, licence MIT
- vs. Claude Opus 4.8 : ~36× entrée cache-miss, ~179× cache-hit, ~89× sortie (médias financiers)
- Efficience long contexte : 27 % FLOPs / 10 % KV-cache vs. V3.2 (claim éditeur)
- OpenRouter : preview Flash #1 volume sept semaines avant 31/07
- Financement (contexte, non vérifié) : médias ~7,4 Md $, valorisation ~48,7 Md $
Sources officielles et tierces — à revérifier après mise à jour :
DeepSeek API — documentation et changelog
Hugging Face — deepseek-ai/DeepSeek-V4-Flash
Artificial Analysis — Intelligence Index et coût par tâche
V4-Flash-0731 mérite une évaluation sérieuse — 82,7 TerminalBench, prix imbattable, poids MIT — mais un déploiement enterprise prudent exige de traiter les scores Harness comme provisoires, d'attendre V4-Pro GA et de ne pas confondre API et app grand public. L'architecture recommandée : API DeepSeek pour inférence agent à coût minimal, nœuds physiques VPSNIX M4/M4 Pro pour builds natifs Apple Silicon — matériel Apple 100 %, root complet, zéro taxe de virtualisation. Les Mac virtualisés souffrent de pertes Hypervisor, Metal instable et signature Xcode fragile — inadaptés aux pipelines agent 7×24. Consultez les tarifs et ancrez inférence et compilation sur des couches distinctes et stables.
SECTION 06 FAQ
Quelle différence entre V4 Flash et V3.2 ?
Contexte natif 1M tokens avec compute réduit (27 % FLOPs, 10 % KV-cache selon l'éditeur). Optimisation agent pour Claude Code, OpenCode et le futur Harness. Le post-training prime sur la croissance paramétrique.
Flash ou Pro au quotidien ?
Pour dialogue, batch et agents à budget serré : V4-Flash-0731 — scores agent supérieurs au Pro preview à une fraction du prix. Pour raisonnement complexe et budget large : Pro preview jusqu'au GA officiel.
V4-Pro officiel est-il disponible ?
Non au 5 août 2026 — seul Flash-0731 officiel, API uniquement. Pro GA et Harness : changelog dit « prochainement », sans date. Les dates 10–20 août des médias ne sont pas confirmées.
Peut-on croire les benchmarks DeepSeek ?
SWE-bench Verified a une acceptation plus large. TerminalBench et Toolathlon sont harness-dépendants et vendor-run — DeepSeek prévient de la sensibilité au framework. Attendre reproduction communautaire avec d'autres outils agent.
Dois-je modifier mon code ?
Si vous utilisez déjà deepseek-v4-flash : upgrade automatique vers 0731. Si vous appelez encore deepseek-chat ou deepseek-reasoner : migrer immédiatement — endpoints retirés le 24 juillet.
Qu'est-ce que DeepSeek Harness ?
Premier framework d'exécution agent maison — fichiers, outils, engineering multi-étapes. Alternative interne à Claude Code. Mentionné le 31 juillet, pas encore publié.