Si vous facturez de l'inférence via DeepSeek, Qwen ou GLM, la semaine du 17 août 2026 paraît incohérente : une hausse officielle pouvant atteindre 1 100 %, un flagship Alibaba à 2,4 billions de paramètres désormais téléchargeable, et un GLM-5.3 qui gagne environ 6× sur Terminal-Bench 3.0 sans toucher à la base 743B. Le fil n'est pas « la Chine cesse d'être bon marché » : les laboratoires passent de la guerre du prix unitaire à celle du pouvoir de tarifer. On assemble ici la chronologie, les grilles, les trois leviers, un comparatif, les zones encore non vérifiées et une checklist en six étapes.
SECTION 01 Quatre pièges avant de citer la hausse DeepSeek de 1 100 %
- Le titre est une ligne de facturation, pas la facture : « 11× », « plus de 1 100 % » et « 350 % » sont tous exacts. Ils correspondent à l'entrée cache-hit en pic, à la sortie, et à l'entrée cache-miss. La sortie (350 %) et le cache-miss pèsent davantage sur une facture réelle que le palier cache-hit, proche de zéro au départ.
- Les heures de pointe suivent Pékin : 9 h–12 h et 14 h–18 h. Le reste est hors pic, à la moitié du tarif de pointe. L'annonce vous demande de déplacer la charge, pas seulement de payer plus.
- Open weights n'est pas Apache 2.0 : Qwen3.8-Max porte une licence custom. Une activité Model-as-a-Service ou AI Work Assistant au-delà de 50 millions de dollars sur une fenêtre de 12 mois exige un accord commercial distinct. Les allégations d'interdiction de téléchargement pour les utilisateurs US, UE, Royaume-Uni ou Corée sont fausses.
- GLM-5.3 n'est pas une nouvelle base : mêmes 743B paramètres que GLM-5.2. Les gains viennent d'un RL de post-training mis à l'échelle. Les scores sont auto-déclarés ; aucune re-exécution indépendante n'est publique. Contexte produit : DeepSeek V4 GA et tarification selon l'heure, brief de lancement Qwen3.8-Max.
SECTION 02 Chronologie : ce qui a été publié, et quand les prix ont vraiment changé
| Date | Événement |
|---|---|
| 16 juil. 2026 | Moonshot AI ouvre les poids de Kimi K3 (2,8 T paramètres), sous surveillance sécuritaire américaine |
| 30 juil. 2026 | OpenAI baisse GPT-5.6 Luna de 80 % |
| 2–3 août 2026 | Alibaba prévisualise puis lance Qwen3.8-Max en API hébergée |
| 6–7 août 2026 | OpenAI fait de Luna le défaut gratuit, chats texte illimités |
| 10 août 2026 | Meta publie Muse Glimmer (30B, Apache 2.0) et évoque des poids ouverts pour le flagship Muse Spark 1.2 |
| 12 août 2026 | Alibaba publie Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6 |
| 13 août 2026 | DeepSeek-V4-Pro passe en GA et annonce une hausse au 17 août ; Google livre Gemini 3.7 Flash à tarif réduit |
| 14 août 2026 | Zhipu livre GLM-5.3, en réutilisant la base 743B de GLM-5.2 |
| 17 août 2026, 00 h 00 Pékin | Les nouveaux tarifs DeepSeek prennent effet |
En recul : pendant que les labs chinois relèvent les prix et ouvrent des poids flagship, les labs américains baissent et gratuisent la couche grand public. Deux faces du même affrontement. La baisse OpenAI est détaillée dans la note tarifaire GPT-5.6 Luna / Terra / Sol.
SECTION 03 Les chiffres : paliers DeepSeek, specs Qwen, post-training GLM uniquement
Les nouveaux tarifs DeepSeek s'appliquent à 00 h 00, heure de Pékin, le 17 août. Heures de pointe : 9 h–12 h et 14 h–18 h, heure de Pékin. Montants ci-dessous en RMB par million de tokens, recoupés avec l'annonce officielle et plusieurs reportages.
| Poste | Ancien tarif | Nouveau hors pic | Nouveau pic | Hausse en pic |
|---|---|---|---|---|
| V4-Flash cache hit (entrée) | ¥0,02 | ¥0,05 | ¥0,10 | ~400 % |
| V4-Flash cache miss (entrée) | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash sortie | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro cache hit (entrée) | ¥0,025 | ¥0,15 | ¥0,30 | ~1 100 % |
| V4-Pro cache miss (entrée) | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro sortie | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Le 1 100 % s'applique à l'entrée cache-hit en heures de pointe — le palier qui partait le plus près de zéro. La sortie, qui domine la plupart des factures réelles, monte de 350 %. Une modélisation indépendante d'une charge lourde hors pic, à moitié cache-hit, se situe plutôt autour de 1,8×.
| Spécification | Détail |
|---|---|
| Paramètres | 2,4 T au total, 95B actifs par token (MoE, 512 experts, 10 routés + 1 partagé) |
| Fenêtre de contexte | 262 144 tokens natifs (checkpoint ouvert), extensible à ~1,01 M ; le Max hébergé est à 1 M par défaut |
| Cadence de sortie | Preview 2 août → API live 3 août → poids ouverts 12 août |
| Tarif API (international) | 2 $ / M en entrée, 6 $ / M en sortie |
| Licence | Pas Apache 2.0 — une Qwen3.8-Max License custom |
| Pourquoi ça compte | Première fois qu'Alibaba ouvre les poids d'un flagship palier Max ; Qwen3.5 / 3.6 / 3.7 Max restaient API uniquement |
| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 pts |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 pts |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 pts |
| CyberGym | 77,2 % | 84,5 % | +7,3 pts |
| AutomationBench | 26,2 % | 48,2 % | +22,0 pts |
Ce sont les chiffres de Zhipu. Aucune re-exécution tierce indépendante n'a été publiée. Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %). C'est un très bon résultat open-weight, pas une victoire frontier nette.
SECTION 04 Trois leviers : tarification horaire, licence custom, post-training à l'échelle
DeepSeek : un problème de capacité, pas un revirement stratégique
La lecture facile serait : « le modèle chinois le moins cher cède enfin à la pression de marge ». La structure dit plutôt l'inverse : la contrainte compute devient visible sur la grille. Un tarif plat, toujours bas, servait d'acquisition tant que l'offre GPU suivait. Quand l'usage a crû de façon exponentielle et pas la capacité, il a fallu rendre quelque chose explicite. « Encourager une planification plus souple des charges » est le langage corporate de « le compute de pointe est désormais rare — déplacez la charge vous-mêmes ».
Un détail souvent absent de la couverture internationale : en heures de pointe, l'API officielle DeepSeek dépasse désormais plusieurs revendeurs tiers (GMI Cloud, Novita et d'autres listent encore V4 Pro sous le nouveau pic officiel). L'hypothèse « l'API officielle est toujours le chemin le moins cher pour faire tourner DeepSeek » est rompue pour la première fois.
Alibaba : les poids ouverts achètent l'esprit ; la licence protège le plafond de revenus
Alibaba a fait deux gestes à la fois. Publier le checkpoint 2,4 T en téléchargement libre. Et y attacher une licence custom — pas l'Apache 2.0 des Qwen plus petits — qui impose à toute activité Model-as-a-Service ou AI Work Assistant gagnant plus de 50 millions de dollars sur une période de 12 mois de négocier une licence commerciale distincte, et qui exige des produits à 100 M+ d'utilisateurs actifs mensuels ou 20 M$+ de revenus mensuels d'afficher le nom du modèle de façon proéminente.
Donner les poids pour gagner les développeurs, surtout à l'international. Garder un levier sur la poignée d'entreprises capables de monter une inférence concurrente par-dessus. C'est un pari différent de Muse Glimmer de Meta, livré sous Apache 2.0 sans restriction. Les allégations d'interdiction de téléchargement depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud sont fausses. Le texte publié n'a aucune clause géographique.
GLM-5.3 : pas de nouvelle base — la méthode est l'histoire
Même fondation 743B que GLM-5.2. Pas de réentraînement. Un saut d'environ 6× sur Terminal-Bench 3.0 (4,6 % → 28,3 %) en mettant à l'échelle les environnements de reinforcement learning en post-training. Alors que les lois d'échelle du pré-entraînement montrent des rendements décroissants, le RL de post-training devient un levier autonome, avec un plancher de coût bien plus bas que le réentraînement d'un modèle de fondation. Un lab de milieu de tableau, sans le compute d'OpenAI, peut encore refermer l'écart sur les benchmarks agentiques et de code.
V4-Pro par 1M tokens CNY (pic Pékin 09-12 / 14-18)
hors-pic cache-hit 0.15 miss 4.5 out 13.5
pic cache-hit 0.30 miss 9.0 out 27.0
titre ~1100% = entrée cache-hit en heures de pointe uniquement
SECTION 05 Comparatif : DeepSeek reste-t-il le frontier le moins cher ?
| Modèle | Entrée | Sortie | Poids ouverts ? |
|---|---|---|---|
| DeepSeek V4-Pro (pic) | ¥9,0 (~1,26 $) | ¥27,0 (~3,78 $) | Non |
| DeepSeek V4-Pro (hors pic) | ¥4,5 (~0,63 $) | ¥13,5 (~1,89 $) | Non |
| Qwen3.8-Max (API internationale) | 2,00 $ | 6,00 $ | Oui (licence custom) |
| OpenAI GPT-5.6 Luna | 0,20 $ | 1,20 $ | Non |
| Claude Opus 5 (implicite, ratio Alibaba) | ~5,00 $ | ~25,00 $ | Non |
Conversion RMB–USD autour de ¥7,15 / 1 $, approximative. Le V4-Pro hors pic reste nettement sous Claude Opus 5, mais ce n'est plus l'option la moins chère tout court. Le tarif international de Qwen3.8-Max et Luna d'OpenAI sous-cotent tous deux le hors pic DeepSeek. « Modèle chinois = modèle le moins cher » a tenu l'essentiel de 2025 et du début 2026. Ce n'est plus une hypothèse sûre.
SECTION 06 Ce qui reste contesté ou non vérifié
- Le titre 1 100 % est exact et trompeur sans contexte. Il ne concerne que l'entrée cache-hit en heures de pointe. La sortie — le poste qui domine la plupart des factures réelles — monte de 350 %.
- Les allégations selon lesquelles Qwen3.8-Max tournerait sur les puces internes Zhenwu M890 d'Alibaba (et des supernodes « Pangu AL128 »), relayées par plusieurs médias financiers chinois, n'ont pas été confirmées de façon indépendante par la documentation technique Alibaba ni par des benchmarks tiers. À traiter comme un reportage proche de l'éditeur, non vérifié.
- La « vulnérabilité grave » dans Cursor attribuée à GLM-5.3 vient de VentureBeat et de la propre divulgation de Zhipu. Les détails techniques n'ont pas été rendus publics. Lecture : source éditeur, pas audit indépendant.
- Les reports selon lesquels le ministère chinois du Commerce préparerait des contrôles d'export de rétorsion sur les technologies IA / semi-conducteurs restent spéculatifs, issus de médias non confirmés, pas d'une annonce officielle.
SECTION 07 Pourquoi ça compte : deux guerres de prix en parallèle
Sur le mois écoulé, les labs chinois de premier plan ont livré à un rythme que la presse financière intérieure appelle « trois mises à jour de modèles par semaine ». DeepSeek, Alibaba et Zhipu s'ajoutent à Kimi K3 de Moonshot (poids ouverts le 16 juillet, 2,8 T) et à MiniMax H3. La couverture chinoise y voit des sorties open-weight qui forcent une revalorisation mondiale du secteur — plus assertive que la plupart des briefs produit en anglais. Contexte Kimi K3 : ouverture complète des poids Kimi K3.
Les labs américains jouent l'inverse sur la couche grand public. OpenAI a coupé son palier le moins cher de 80 % le 30 juillet, puis l'a rendu gratuit et illimité une semaine plus tard. Google a livré le 13 août un modèle orienté code à la moitié du prix de son prédécesseur vieux de trois semaines. Les labs chinois ouvrent des flagships et introduisent une tarification étagée, plus haute, sur le haut de gamme contraint en compute. Les labs américains courent vers le gratuit et le bon marché côté consommateur. Les deux dynamiques sont réelles. Elles optimisent des étages différents de l'entonnoir.
Il y a aussi une couche géopolitique à nommer avec prudence. Kimi K3 de Moonshot a déjà attiré la surveillance sécuritaire américaine. Certains analystes lisent le choix d'Alibaba d'ouvrir un flagship 2,4 T dans cette fenêtre comme une manière de verrouiller l'esprit international et un récit de « parité technologique » avant un éventuel durcissement réglementaire. C'est une interprétation informée, pas un fait confirmé — et facile à manquer si l'on ne lit que la presse tech anglophone, qui traite souvent ces sorties comme des news produit isolées.
SECTION 08 Checklist en six étapes pour relire la hausse sur votre facture
- Séparer le titre avant de multiplier la facture. Entrée cache-hit, entrée cache-miss et sortie sont des lignes distinctes. N'appliquez pas 1 100 % au mois entier.
- Projeter le trafic sur les fenêtres de pic de Pékin. 9 h–12 h et 14 h–18 h, heure de Pékin, facturent au tarif de pointe. Évaluations par lots, distillation hors ligne et replay d'agents de nuit appartiennent au hors pic.
- Estimer avec votre vrai taux de cache-hit. Les gros utilisateurs à fort cache-hit et trafic surtout hors pic ont été modélisés autour de 1,8×. Pic plus faible hit rate, c'est ce qui se rapproche du titre.
- Lire le fichier Qwen3.8-Max License, pas le fil d'annonce. Usage personnel et interne largement non affecté. Revenus MaaS / AI Work Assistant au-delà de 50 millions de dollars sur une période de 12 mois : licence commerciale distincte. 100 M+ MAU ou 20 M$+ de revenus mensuels : affichage proéminent du nom du modèle. Pas d'interdiction géographique.
- Tenir les scores éditeur GLM-5.3 à l'écart des re-exécutions tierces. 4,6 % → 28,3 % sur Terminal-Bench 3.0 est auto-déclaré. N'écrivez pas « victoire frontier » tant qu'une re-exécution indépendante n'existe pas.
- Parkez les allégations non vérifiées dans un registre à part. Zhenwu M890 / Pangu AL128, la vulnérabilité Cursor et les rumeurs de contrôle d'export ne sont pas des faits confirmés. Les évaluations sensibles et les expériences hors pic qui exigent un egress maîtrisé et le Root appartiennent à un nœud physique isolé, pas à une session cloud partagée.
SECTION 09 Chiffres citables et sources primaires
- V4-Pro entrée cache-hit en pic : ¥0,025 → ¥0,30, ~1 100 % ; sortie ¥6,0 → ¥27,0, 350 %
- Qwen3.8-2.4T-A95B : 2,4 T total / 95B actifs ; 262K natifs, ~1,01 M extensible ; API internationale 2 $ / 6 $
- GLM-5.3 Terminal-Bench 3.0 : 4,6 % → 28,3 % (+23,7), même base 743B, pas de réentraînement ; auto-déclaré
- Seuils de licence : 50 M$ / 12 mois MaaS ou AI Work Assistant = licence distincte ; 100 M MAU ou 20 M$ de revenus mensuels = nommage proéminent
Liens officiels et tiers ci-dessous. Vérifiez les derniers tarifs officiels et les termes de licence avant republication. Les points signalés plus haut comme non vérifiés (allégations de puces domestiques, reportage sur la vulnérabilité Cursor, rumeurs de contrôle d'export) n'ont pas été confirmés de façon indépendante.
Sources officielles / dépôts :
DeepSeek API Docs — DeepSeek-V4-Pro GA Release (mise à jour tarifaire)
Hugging Face — Qwen/Qwen3.8-2.4T-A95B
Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities
Reportages tiers :
21jingji — DeepSeek peak/off-peak rates take effect, peak hike up to 1,100%
VentureBeat — GLM-5.3 and the reported Cursor vulnerability
Dès qu'une API partagée bascule en tarification selon l'heure, le taux de cache-hit et l'isolation egress deviennent des variables de facture. Empiler évaluations, distillation et agents 24/7 sur une même session partagée rend le coût et la politique de sortie plus difficiles à maîtriser — y compris pour un pipeline créatif Apple (Xcode, Final Cut, agents de production). Pour un compute natif sans perte, un CI/CD iOS stable et des agents IA en continu, un nœud physique cloud VPSNIX est en général le meilleur choix : matériel Apple d'origine, Root complet, zéro taxe hyperviseur, facturation jour / semaine / mois, pour séparer les expériences hors pic de la chaîne de production. Voir le comparatif location Mac mini M4 et la page tarifs.
SECTION 10 FAQ
DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude après la hausse ?
Son tarif hors pic reste inférieur à Claude Opus 5, mais ce n'est plus l'option unique la moins chère. GPT-5.6 Luna d'OpenAI (0,20 $ / 1,20 $ par million de tokens) et le tarif international Qwen3.8-Max d'Alibaba (2 $ / 6 $) sous-cotent désormais le hors pic DeepSeek sur au moins une dimension. DeepSeek reste relativement bon marché pour un modèle de classe frontier, simplement plus le moins cher tout court.
Puis-je utiliser gratuitement les poids ouverts Qwen3.8-Max d'Alibaba dans un produit commercial ?
Oui dans la plupart des cas — projets personnels et usage interne d'entreprise non affectés. Le verrou s'applique si vous exploitez une activité Model-as-a-Service ou AI Work Assistant ayant gagné plus de 50 millions de dollars sur une période consécutive de 12 mois ; ce palier exige une licence commerciale distincte auprès d'Alibaba.
Qwen3.8-Max est-il interdit ou restreint pour les utilisateurs US, UE ou Royaume-Uni ?
Non. Cette allégation a circulé en ligne mais elle est fausse — la licence publiée ne contient aucune restriction géographique. Les contraintes sont liées aux revenus, pas au lieu où vous ou vos utilisateurs vous trouvez.
Quelle est la vraie différence entre GLM-5.3 et GLM-5.2 ?
Rien au niveau de la base — les deux utilisent le même modèle de fondation à 743 milliards de paramètres. Les gains (environ 6× sur Terminal-Bench 3.0) viennent entièrement de la mise à l'échelle du reinforcement learning en post-training, sans réentraînement de la base.
Meta va-t-elle vraiment ouvrir son flagship, pas seulement le plus petit Muse Glimmer ?
Pas encore. Muse Glimmer est un modèle distillé 30B, pas le vrai flagship de Meta. Mark Zuckerberg a dit que les poids ouverts du Muse Spark 1.2, plus large et encore fermé, arriveraient « bientôt » — ce qui, si cela se produit, en ferait le premier modèle américain de palier flagship publié ouvertement. À l'heure où nous écrivons, cette sortie n'a pas eu lieu ; à traiter comme une intention déclarée, pas un fait confirmé.