Accueil / Blog / DeepSeek V4
ENGINEERING_BLOG · 2026.07.20

DeepSeek V4 GA : tarifs, architecture et écart face à GPT-5.6

DEEPSEEK V4-PRO · SWE-bench Verified
80.6%

Record open source, ex æquo Gemini 3.1 Pro ; sortie dès 0,87 $/M (heures creuses).

Trois mois d'attente se concluent le 20 juillet 2026 : DeepSeek V4 GA est en production. Si vous comparez les LLM open source en 2026 ou hébergez encore deepseek-chat, ce guide s'adresse aux développeurs IA et décideurs techniques — architecture CSA/HCA/mHC, benchmarks face à GPT-5.6 et Claude Fable 5, grille heures pleines/creuses et migration API avant le 24 juillet. Verdict immédiat : V4 ne dépasse pas encore les flagship fermés, mais offre la meilleure performance open source à 1/10 voire 1/100 du coût ; la tarification horaire ajoute de la complexité, mais 0,87 $/M en sortie reste très compétitif.

SECTION 01 Trois alertes pour les équipes au lancement du GA

  • Fin de vie des anciens endpoints : deepseek-chat et deepseek-reasoner cessent le 24 juillet 2026 à 23:59 (heure de Pékin) — toute production non migrée tombe en panne.
  • Première tarification heures pleines/creuses : les créneaux 09:00–12:00 et 14:00–18:00 en semaine doublent les tarifs ; un pipeline 24/7 non planifié peut exploser la facture.
  • L'API cloud ne remplace pas la chaîne de build native : même V4-Pro ne signe ni ne compile de façon fiable sur macOS virtualisé ; voir le comparatif location vs achat Mac mini M4 pour l'infrastructure Apple.
  • Preview vs GA : même architecture, mais gains ciblés sur agents, mathématiques et code — évaluez sur la nouvelle grille tarifaire, pas sur l'avril preview.

SECTION 02 Chronologie : de la preview au GA du 20 juillet

Jalons DeepSeek V4
Date Événement
2026-04-24 Preview V4 + open source MIT : V4-Pro (1,6T) et V4-Flash (284B)
2026-05 Versions production Flash et Pro, API généralisée
2026-06 Sortie V4-Pro −75 % permanente à 0,87 $/M tokens
2026-06-29 Email API : GA mi-juillet, première annonce heures pleines/creuses
2026-07-19 Accès grisé GA pour développeurs sélectionnés, rumeurs presse
2026-07-20 GA officiel en ligne
2026-07-24 deepseek-chat et deepseek-reasoner hors service

En résumé : la preview était déjà solide ; le GA affine agents, raisonnement mathématique et génération de code tout en instaurant une facturation structurée — passage d'un modèle quasi gratuit à une exploitation commerciale disciplinée.

SECTION 03 V4-Pro et V4-Flash : CSA, HCA, mHC, Muon et trois modes d'inférence

Famille DeepSeek V4 — spécifications
Spécification V4-Pro V4-Flash
Paramètres totaux 1,6 billion (1,6T) 284 milliards (284B)
Paramètres actifs/token 49 milliards (49B) 13 milliards (13B)
Couches Transformer 61 43
Fenêtre de contexte 1 000 000 tokens 1 000 000 tokens
Sortie max 384K tokens 384K tokens
Précision FP4 (experts) + FP8 (reste) FP4 + FP8 mixte
Pré-entraînement 33T+ tokens 32T+ tokens
Licence MIT MIT

V4 abandonne le MLA des versions V2/V3 pour un duo Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA) : CSA compresse la séquence KV ×4 via gating Softmax, indexeur FP4 « lightning » pour top-k (Pro : 1024, Flash : 512) et fenêtre glissante 128 tokens ; HCA compresse ×128 pour attention dense globale. À 1M tokens : 27 % des FLOPs d'inférence vs V3.2, mémoire KV-cache 10 % (Flash : 7 %).

Les Manifold-Constrained Hyper-Connections (mHC) stabilisent 61 couches via flux résiduel 4 canaux et matrices bi-stochastiques. Entraînement avec optimiseur Muon (orthogonalisation Newton-Schulz) plutôt qu'AdamW.

Trois modes d'inférence
Mode Caractéristiques Usage
Non-think Sans chaîne de pensée, latence minimale Q&R simples, routage
Think High Raisonnement explicite (tags thinking) Complexité moyenne, debug code
Think Max Raisonnement maximal, contexte 384K+ Mathématiques, agents longue chaîne

Paramètres d'échantillonnage recommandés : temperature=1.0, top_p=1.0.

SECTION 04 Benchmarks : SWE-bench 80,6 % et rapport de coût 116×

V4-Pro — benchmarks clés
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % 96,0 % non publié séparément ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3 206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

SWE-bench Verified mesure la correction de bugs sur dépôts GitHub réels — 80,6 % est le record open source, ex æquo Gemini 3.1 Pro. D'après Artificial Analysis, Claude Fable 5 coûte 3,48 $ par tâche Strategy & Ops (50 points), V4-Pro 0,03 $ (38 points) — Fable 5 est 116× plus cher pour ~12 points d'écart (~31 %).

SECTION 05 Face à GPT-5.6 / Claude Fable 5 et grille heures pleines/creuses

Trois modèles frontier comparés
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open source / self-host MIT Non Non
Contexte 1M tokens non divulgué 1M tokens
Sortie API (heures creuses) 0,87 $/M ~15 $/M 50 $/M
Sortie API (heures pleines) 1,74 $/M
Capacité code Très forte (proche Fable 5) Très forte Leader
Confidentialité Déploiement privé possible Cloud only Cloud only

Choix par scénario : budget / haute fréquence / self-host → V4-Pro ou Flash ; code maximal → Claude Fable 5 ; mathématiques avancées → GPT-5.6 Sol/Ultra ; logs massifs → V4-Flash (entrée cache hit 0,0028 $/M). Pour une vue d'ensemble open source, voir aussi l'analyse Kimi K3 (2,8T).

Tarifs heures pleines/creuses (pleines : lun–ven 09:00–12:00, 14:00–18:00 Pékin, ×2)
Modèle Poste Heures creuses Heures pleines
V4-Pro Entrée (cache hit) ¥0,025 / 0,0035 $ / 1M ×2
V4-Pro Entrée (cache miss) ¥3,00 / 0,435 $ / 1M ¥6,00 / 0,87 $ / 1M
V4-Pro Sortie ¥6,00 / 0,87 $ / 1M ¥12,00 / 1,74 $ / 1M
V4-Flash Entrée (cache hit) ¥0,02 / 0,0028 $ / 1M ×2
V4-Flash Entrée (cache miss) ¥1,00 / 0,14 $ / 1M ¥2,00 / 0,28 $ / 1M
V4-Flash Sortie ¥2,00 / 0,28 $ / 1M ¥4,00 / 0,56 $ / 1M

Optimisation : planifier les batchs après 18:00 ou avant 09:00 ; exploiter le Prompt Cache ; router le simple vers Flash, le complexe vers Pro. Même en heures pleines, la sortie V4-Pro à 1,74 $/M reste 8,6× moins chère qu'Opus 4.8 (15 $/M).

SECTION 06 Migration API avant le 24 juillet : six étapes et exemple Python

Attention : deepseek-chat et deepseek-reasoner s'arrêtent le 24 juillet 2026 à 15:59 UTC (23:59 Pékin).

Table de migration
Ancien modèle Nouveau modèle Note
deepseek-chat deepseek-v4-flash (Non-think) Rapide, tâches légères
deepseek-reasoner deepseek-v4-flash (mode Think) ou upgrade deepseek-v4-pro
  1. Rechercher les anciens noms : code, CI et variables d'environnement pour deepseek-chat / deepseek-reasoner.
  2. Choisir le modèle cible : dialogue léger → deepseek-v4-flash ; raisonnement complexe → deepseek-v4-pro.
  3. Mettre à jour le SDK OpenAI : modifier uniquement model, conserver base_url=https://api.deepseek.com.
  4. Activer le mode thinking (option) : via extra_body pour remplacer deepseek-reasoner.
  5. Tests de charge staging : valider latence, facturation tokens et impact heures pleines/creuses.
  6. Déploiement graduel avant le 24/07 : basculer la production, surveiller les erreurs ; DeepSeek prévient par email 24 h avant tout changement tarifaire.
deepseek_v4_migration.py
from openai import OpenAI

client = OpenAI(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Analyse ce code Swift pour les goulots de performance..."}],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 accepte OpenAI ChatCompletions et Anthropic Messages ; avec le SDK Anthropic, base_url inchangé, modeldeepseek-v4-pro.

SECTION 07 Données citables, sources et stack recommandée

  • KV-cache : 10 % de la mémoire V3.2 à 1M tokens (Flash : 7 %)
  • FLOPs inférence : 27 % vs V3.2 en scénario 1M
  • Rapport de coût : V4-Pro 0,03 $ vs Fable 5 3,48 $ par tâche — facteur 116
  • Heures pleines : sortie 1,74 $/M = 1/8,6 d'Opus 4.8
  • Deadline migration : 2026-07-24 23:59 Pékin
  • Sampling : temperature=1.0, top_p=1.0

Sources officielles et tierces — revérifier après mise à jour :

DeepSeek API — documentation officielle

arXiv:2606.19348 — article technique DeepSeek V4

Artificial Analysis — données coût/performance

DeepSeek V4 GA marque 2026 pour l'open source — non par la victoire sur Claude Fable 5 ou GPT-5.6, mais par un rapport performance/prix inédit. Pourtant un LLM cloud ne compile pas Xcode, ne débogue pas Metal ni ne gère les certificats iOS ; macOS virtualisé implique risque EULA et 20–40 % de perte. Stack efficace pour les workflows créatifs Apple : API V4 pour contexte long et orchestration d'agents, nœuds physiques VPSNIX M4/M4 Pro pour compilation native et déploiement 7×24 — hardware Apple d'origine, Root complet, zéro hyperviseur. Tarifs sur la page pricing ; après l'analyse Kimi K3, ancrez le compute dans un environnement physique conforme plutôt que de parier sur un seul fournisseur API.

SECTION 08 FAQ

Différence entre GA et preview ?

Même architecture ; le GA améliore agents, maths et code, introduit heures pleines/creuses. Anciens endpoints arrêtés le 24 juillet.

Quand s'appliquent les heures pleines ?

Lun–ven 09:00–12:00 et 14:00–18:00 (Pékin), tarifs ×2 ; hors créneau = heures creuses.

V4-Pro ou V4-Flash ?

Flash pour routage léger et haute fréquence (sortie 0,28 $/M) ; Pro pour raisonnement et code (sortie 0,87 $/M, SWE-bench 80,6 %).

Self-hosting possible ?

Oui — licence MIT, V4-Pro 1,6T exige un large cluster GPU ; pour la plupart des équipes, l'API reste plus économique.