Trois mois d'attente se concluent le 20 juillet 2026 : DeepSeek V4 GA est en production. Si vous comparez les LLM open source en 2026 ou hébergez encore deepseek-chat, ce guide s'adresse aux développeurs IA et décideurs techniques — architecture CSA/HCA/mHC, benchmarks face à GPT-5.6 et Claude Fable 5, grille heures pleines/creuses et migration API avant le 24 juillet. Verdict immédiat : V4 ne dépasse pas encore les flagship fermés, mais offre la meilleure performance open source à 1/10 voire 1/100 du coût ; la tarification horaire ajoute de la complexité, mais 0,87 $/M en sortie reste très compétitif.
SECTION 01 Trois alertes pour les équipes au lancement du GA
- Fin de vie des anciens endpoints :
deepseek-chatetdeepseek-reasonercessent le 24 juillet 2026 à 23:59 (heure de Pékin) — toute production non migrée tombe en panne. - Première tarification heures pleines/creuses : les créneaux 09:00–12:00 et 14:00–18:00 en semaine doublent les tarifs ; un pipeline 24/7 non planifié peut exploser la facture.
- L'API cloud ne remplace pas la chaîne de build native : même V4-Pro ne signe ni ne compile de façon fiable sur macOS virtualisé ; voir le comparatif location vs achat Mac mini M4 pour l'infrastructure Apple.
- Preview vs GA : même architecture, mais gains ciblés sur agents, mathématiques et code — évaluez sur la nouvelle grille tarifaire, pas sur l'avril preview.
SECTION 02 Chronologie : de la preview au GA du 20 juillet
| Date | Événement |
|---|---|
| 2026-04-24 | Preview V4 + open source MIT : V4-Pro (1,6T) et V4-Flash (284B) |
| 2026-05 | Versions production Flash et Pro, API généralisée |
| 2026-06 | Sortie V4-Pro −75 % permanente à 0,87 $/M tokens |
| 2026-06-29 | Email API : GA mi-juillet, première annonce heures pleines/creuses |
| 2026-07-19 | Accès grisé GA pour développeurs sélectionnés, rumeurs presse |
| 2026-07-20 | GA officiel en ligne |
| 2026-07-24 | deepseek-chat et deepseek-reasoner hors service |
En résumé : la preview était déjà solide ; le GA affine agents, raisonnement mathématique et génération de code tout en instaurant une facturation structurée — passage d'un modèle quasi gratuit à une exploitation commerciale disciplinée.
SECTION 03 V4-Pro et V4-Flash : CSA, HCA, mHC, Muon et trois modes d'inférence
| Spécification | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion (1,6T) | 284 milliards (284B) |
| Paramètres actifs/token | 49 milliards (49B) | 13 milliards (13B) |
| Couches Transformer | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Sortie max | 384K tokens | 384K tokens |
| Précision | FP4 (experts) + FP8 (reste) | FP4 + FP8 mixte |
| Pré-entraînement | 33T+ tokens | 32T+ tokens |
| Licence | MIT | MIT |
V4 abandonne le MLA des versions V2/V3 pour un duo Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA) : CSA compresse la séquence KV ×4 via gating Softmax, indexeur FP4 « lightning » pour top-k (Pro : 1024, Flash : 512) et fenêtre glissante 128 tokens ; HCA compresse ×128 pour attention dense globale. À 1M tokens : 27 % des FLOPs d'inférence vs V3.2, mémoire KV-cache 10 % (Flash : 7 %).
Les Manifold-Constrained Hyper-Connections (mHC) stabilisent 61 couches via flux résiduel 4 canaux et matrices bi-stochastiques. Entraînement avec optimiseur Muon (orthogonalisation Newton-Schulz) plutôt qu'AdamW.
| Mode | Caractéristiques | Usage |
|---|---|---|
| Non-think | Sans chaîne de pensée, latence minimale | Q&R simples, routage |
| Think High | Raisonnement explicite (tags thinking) | Complexité moyenne, debug code |
| Think Max | Raisonnement maximal, contexte 384K+ | Mathématiques, agents longue chaîne |
Paramètres d'échantillonnage recommandés : temperature=1.0, top_p=1.0.
SECTION 04 Benchmarks : SWE-bench 80,6 % et rapport de coût 116×
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % | 96,0 % | non publié séparément | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified mesure la correction de bugs sur dépôts GitHub réels — 80,6 % est le record open source, ex æquo Gemini 3.1 Pro. D'après Artificial Analysis, Claude Fable 5 coûte 3,48 $ par tâche Strategy & Ops (50 points), V4-Pro 0,03 $ (38 points) — Fable 5 est 116× plus cher pour ~12 points d'écart (~31 %).
SECTION 05 Face à GPT-5.6 / Claude Fable 5 et grille heures pleines/creuses
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source / self-host | MIT | Non | Non |
| Contexte | 1M tokens | non divulgué | 1M tokens |
| Sortie API (heures creuses) | 0,87 $/M | ~15 $/M | 50 $/M |
| Sortie API (heures pleines) | 1,74 $/M | — | — |
| Capacité code | Très forte (proche Fable 5) | Très forte | Leader |
| Confidentialité | Déploiement privé possible | Cloud only | Cloud only |
Choix par scénario : budget / haute fréquence / self-host → V4-Pro ou Flash ; code maximal → Claude Fable 5 ; mathématiques avancées → GPT-5.6 Sol/Ultra ; logs massifs → V4-Flash (entrée cache hit 0,0028 $/M). Pour une vue d'ensemble open source, voir aussi l'analyse Kimi K3 (2,8T).
| Modèle | Poste | Heures creuses | Heures pleines |
|---|---|---|---|
| V4-Pro | Entrée (cache hit) | ¥0,025 / 0,0035 $ / 1M | ×2 |
| V4-Pro | Entrée (cache miss) | ¥3,00 / 0,435 $ / 1M | ¥6,00 / 0,87 $ / 1M |
| V4-Pro | Sortie | ¥6,00 / 0,87 $ / 1M | ¥12,00 / 1,74 $ / 1M |
| V4-Flash | Entrée (cache hit) | ¥0,02 / 0,0028 $ / 1M | ×2 |
| V4-Flash | Entrée (cache miss) | ¥1,00 / 0,14 $ / 1M | ¥2,00 / 0,28 $ / 1M |
| V4-Flash | Sortie | ¥2,00 / 0,28 $ / 1M | ¥4,00 / 0,56 $ / 1M |
Optimisation : planifier les batchs après 18:00 ou avant 09:00 ; exploiter le Prompt Cache ; router le simple vers Flash, le complexe vers Pro. Même en heures pleines, la sortie V4-Pro à 1,74 $/M reste 8,6× moins chère qu'Opus 4.8 (15 $/M).
SECTION 06 Migration API avant le 24 juillet : six étapes et exemple Python
Attention : deepseek-chat et deepseek-reasoner s'arrêtent le 24 juillet 2026 à 15:59 UTC (23:59 Pékin).
| Ancien modèle | Nouveau modèle | Note |
|---|---|---|
deepseek-chat |
deepseek-v4-flash (Non-think) |
Rapide, tâches légères |
deepseek-reasoner |
deepseek-v4-flash (mode Think) |
ou upgrade deepseek-v4-pro |
- Rechercher les anciens noms : code, CI et variables d'environnement pour
deepseek-chat/deepseek-reasoner. - Choisir le modèle cible : dialogue léger →
deepseek-v4-flash; raisonnement complexe →deepseek-v4-pro. - Mettre à jour le SDK OpenAI : modifier uniquement
model, conserverbase_url=https://api.deepseek.com. - Activer le mode thinking (option) : via
extra_bodypour remplacerdeepseek-reasoner. - Tests de charge staging : valider latence, facturation tokens et impact heures pleines/creuses.
- Déploiement graduel avant le 24/07 : basculer la production, surveiller les erreurs ; DeepSeek prévient par email 24 h avant tout changement tarifaire.
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Analyse ce code Swift pour les goulots de performance..."}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 accepte OpenAI ChatCompletions et Anthropic Messages ; avec le SDK Anthropic, base_url inchangé, model → deepseek-v4-pro.
SECTION 07 Données citables, sources et stack recommandée
- KV-cache : 10 % de la mémoire V3.2 à 1M tokens (Flash : 7 %)
- FLOPs inférence : 27 % vs V3.2 en scénario 1M
- Rapport de coût : V4-Pro 0,03 $ vs Fable 5 3,48 $ par tâche — facteur 116
- Heures pleines : sortie 1,74 $/M = 1/8,6 d'Opus 4.8
- Deadline migration : 2026-07-24 23:59 Pékin
- Sampling : temperature=1.0, top_p=1.0
Sources officielles et tierces — revérifier après mise à jour :
DeepSeek API — documentation officielle
arXiv:2606.19348 — article technique DeepSeek V4
Artificial Analysis — données coût/performance
DeepSeek V4 GA marque 2026 pour l'open source — non par la victoire sur Claude Fable 5 ou GPT-5.6, mais par un rapport performance/prix inédit. Pourtant un LLM cloud ne compile pas Xcode, ne débogue pas Metal ni ne gère les certificats iOS ; macOS virtualisé implique risque EULA et 20–40 % de perte. Stack efficace pour les workflows créatifs Apple : API V4 pour contexte long et orchestration d'agents, nœuds physiques VPSNIX M4/M4 Pro pour compilation native et déploiement 7×24 — hardware Apple d'origine, Root complet, zéro hyperviseur. Tarifs sur la page pricing ; après l'analyse Kimi K3, ancrez le compute dans un environnement physique conforme plutôt que de parier sur un seul fournisseur API.
SECTION 08 FAQ
Différence entre GA et preview ?
Même architecture ; le GA améliore agents, maths et code, introduit heures pleines/creuses. Anciens endpoints arrêtés le 24 juillet.
Quand s'appliquent les heures pleines ?
Lun–ven 09:00–12:00 et 14:00–18:00 (Pékin), tarifs ×2 ; hors créneau = heures creuses.
V4-Pro ou V4-Flash ?
Flash pour routage léger et haute fréquence (sortie 0,28 $/M) ; Pro pour raisonnement et code (sortie 0,87 $/M, SWE-bench 80,6 %).
Self-hosting possible ?
Oui — licence MIT, V4-Pro 1,6T exige un large cluster GPU ; pour la plupart des équipes, l'API reste plus économique.