Accueil / Blog / Qwen3.8-Max
ENGINEERING_BLOG · 2026.08.04

Qwen3.8-Max GA : Alibaba entre dans la course frontier — sans livrer les poids

QWEN3.8-MAX · Arena Text
#5

1 496 pts provisoires · 2,4T total / 95B actifs · Vision #2 · API 2 $/6 $ par million de tokens

Le 3 août 2026, Alibaba a franchi une étape décisive dans la guerre des modèles chinois : la mise en disponibilité générale de Qwen3.8-Max, son plus grand LLM à ce jour. Avec 2,4 billions de paramètres totaux, 95 milliards activés par requête en architecture MoE sparse, un million de tokens de contexte et une tarification API à 2 $ en entrée et 6 $ en sortie par million de tokens, le modèle se positionne clairement dans le segment frontier à prix intermédiaire. Les classements Arena — cinquième en texte (1 496 points provisoires), deuxième en vision — confirment une trajectoire crédible. Pourtant, la narrative officielle laisse une question ouverte : les poids promis pour la semaine suivante n'étaient toujours pas publiés le 4 août, et la majorité des benchmarks cités proviennent de mesures internes Alibaba. Ce dossier s'adresse aux décideurs techniques et aux architectes qui doivent arbitrer entre Qwen3.8-Max, Kimi K3 et DeepSeek V4 avant un déploiement en production.

SECTION 01 Pourquoi le lancement GA soulève autant de questions de gouvernance

L'été 2026 a vu Moonshot publier l'intégralité des poids Kimi K3 le 27 juillet, suivie quelques jours plus tard par la preview Qwen3.8-Max. Le passage en GA le 3 août était attendu ; ce qui l'est moins, c'est l'écart entre la communication marketing et la réalité opérationnelle. Cinq tensions structurent le débat professionnel autour de ce modèle :

  • La promesse open weights non tenue : Alibaba annonce une première publication de poids pour la classe Max — une novité pour la lignée Qwen — mais au 4 août, seuls l'API Model Studio et la plateforme QwenWork permettent d'accéder au modèle. Les équipes prévoyant un auto-hébergement doivent repousser toute décision d'investissement GPU.
  • Deux régimes de preuve : Arena Text (#5, 1 496 pts provisoires) et Vision (#2) relèvent d'un tiers indépendant. TerminalBench (86,6), PaperBench (93,0) et OSWorld-Verified (86,1) sont des chiffres Alibaba — utiles en interne, insuffisants seuls pour un appel d'offres.
  • L'illusion des 2,4T : en MoE, seuls 95B paramètres s'activent par inférence. Comparer ce chiffre au dense 1,6T de DeepSeek V4-Pro ou aux 2,8T totaux de Kimi K3 sans colonne « actifs » fausse l'analyse coût-performance.
  • Le coût réel du contexte millionnaire : à 2 $/M en entrée, une boucle agent multi-tours sur un corpus long peut exploser le budget mensuel — surtout si les logs et métadonnées transitent par le cloud chinois sans cadre contractuel adapté.
  • Écosystème fragmenté : QwenWork (agent bureautique), Model Studio (API développeurs) et le backend Qwen d'Apple Intelligence en Chine (CAC enregistré le 15 juillet) sont trois canaux aux exigences de conformité distinctes.

SECTION 02 Chronologie du GA et fiche technique consolidée

Jalons Qwen3.8-Max
Date Événement
Fin juillet 2026 Preview limitée sur Model Studio — réponse concurrentielle à l'open weights Kimi K3 (27/07)
3 août 2026 GA mondiale : API Model Studio + QwenWork. Annonce Arena Text #5 (1 496 prov.) et Vision #2
Mi-août (annoncé) Publication des poids sur Hugging Face / ModelScope + variante Qwen3.8-27B — non livrée au 4/08
Spécifications Qwen3.8-Max (GA)
Dimension Valeur
Architecture MoE sparse sur base Qwen 3.5 + attention hybride
Paramètres total / actifs 2,4T / 95B par requête
Contexte 1 048 576 tokens (~1M) · sortie max ~131K
Modalités Multimodal (texte + vision)
Arena (tiers) Text #5 (1 496 prov.) · Vision #2
Benchmarks éditeur TerminalBench 86,6 · PaperBench 93,0 · OSWorld 86,1
Tarification API Entrée 2,00 $ · Sortie 6,00 $ / M tokens
Poids open Non publiés au 4 août 2026

Alibaba livre un modèle crédible sur le papier — cinquième en texte, deuxième en vision, tarif compétitif — mais repousse la preuve ultime du open source : la publication des poids que la communauté attend depuis la preview.

SECTION 03 Arbitrage stratégique face à Kimi K3 et DeepSeek V4

Les trois modèles affichent un contexte d'un million de tokens. La différence se joue sur la transparence, le prix et l'écosystème — pas sur une unique métrique de leaderboard.

Qwen3.8-Max vs Kimi K3 vs DeepSeek V4-Pro
Critère Qwen3.8-Max Kimi K3 DeepSeek V4-Pro
Paramètres 2,4T / 95B MoE 2,8T / 16 experts actifs 1,6T dense
Poids disponibles En attente 27/07 Modified MIT 24/04 MIT
API ($/M in/out) 2 / 6 3 / 15 Variable peak/off-peak
Signal tiers Arena Text #5 · Vision #2 Intelligence Index 57,1 (#3) SWE-bench Verified 80,6 %
Forces Multimodal entreprise · intégration Alibaba Cloud Agent code longue durée · poids complets Coût inférence minimal · code/math
Fragilités Transparence · délai poids · benchmarks internes API chère · 1,4 To à héberger Peak pricing · écart qualité conversation vs closed

Pour approfondir : analyse Kimi K3, classements OpenRouter juillet, release open weights K3.

SECTION 04 QwenWork, Apple Intelligence Chine et le débat sur la transparence

Avec le GA, Alibaba a activé QwenWork (千问办公), plateforme agentique orientée productivité : génération de présentations, tableurs automatisés, rapports de recherche longue durée et démonstrations d'ingénierie logicielle sur seize jours (dont optimisation de conception de puces en 500+ étapes). Ce n'est pas une simple API — c'est un produit SaaS dont les conditions de rétention des données et la localisation doivent être négociées contractuellement.

Parallèlement, l'enregistrement CAC du 15 juillet 2026 a confirmé Qwen comme moteur génératif d'Apple Intelligence sur les appareils vendus en Chine, Baidu assurant la recherche et Siri. Qwen3.8-Max devient un candidat naturel à la montée en capacité — mais le calendrier d'intégration iOS 27 relève d'Apple. Les éditeurs cross-border doivent tester séparément les backends global et Chine.

Canaux de distribution et cas d'usage
Canal Public cible Usage typique
Model Studio API Développeurs · SaaS global RAG long contexte · agents code · analyse multimodale
QwenWork Knowledge workers · entreprise Documents · tableurs · workflows internes
Apple Intelligence (Chine) iPhone/iPad/Mac domestic IA système intégrée · Siri via Baidu
HF / ModelScope (annoncé) Recherche · auto-hébergement Inférence privée · fine-tuning · air-gap

SECTION 05 Checklist en six étapes et données citables

  1. Calendrier poids : bloquer une revue licence dès publication HF/ModelScope — jusqu'alors, qualifier le modèle « API-only » en comité de direction.
  2. Séparer les preuves : Arena (tiers) et benchmarks Alibaba (internes) dans des tableaux distincts avec date de mesure.
  3. Simuler le coût 1M : modéliser vos boucles agent sur 2 $/6 $ ; comparer le routage via OpenRouter.
  4. Tests A/B structurés : mêmes prompts contre K3 (poids locaux) et Qwen (API) sur code front, résumé long et vision — conditions explicites dans le rapport.
  5. Cadrer QwenWork vs API maison : residency des données, région Alibaba Cloud, durée de logs — DPA obligatoire pour SaaS entreprise.
  6. Documenter les risques de transparence : promesse poids non tenue, benchmarks vendor-run, score Arena provisoire — dans le procès-verbal de sélection.
  7. Séparer inférence et compilation : aucun LLM ne signe dans Xcode — prévoir nœuds M4 cloud pour CI/CD iOS en parallèle.
  • Paramètres : 2,4T total / 95B actifs (MoE)
  • Contexte : 1M entrée · ~131K sortie
  • Arena : Text #5 (1 496 prov.) · Vision #2
  • API : 2 $ / 6 $ par M tokens
  • Poids : non publiés au 4/08 ; annonce semaine post-GA
  • Concurrents : K3 3 $/15 $ · V4-Pro off-peak output 0,87 $/M

Sources officielles et indépendantes — à revérifier après mise à jour :

Alibaba Cloud — communiqué Qwen3.8-Max GA

Alibaba Cloud Model Studio — documentation API

Arena.ai — leaderboards Text / Vision

Qwen3.8-Max mérite une évaluation sérieuse : cinquième en texte, deuxième en vision, tarif API raisonnable. Mais un déploiement enterprise prudent exige d'attendre les poids, de reproduire les benchmarks en interne et de ne pas confondre promesses marketing et preuves indépendantes. L'architecture recommandée : Model Studio ou endpoint privé pour l'inférence longue durée, nœuds physiques VPSNIX M4/M4 Pro pour builds natifs Apple Silicon et pipelines iOS — matériel Apple 100 %, root complet, zéro taxe de virtualisation, facturation flexible. Consultez les tarifs et ancrez vos agents sur une infrastructure conforme.

SECTION 06 FAQ

Quand Qwen3.8-Max est-il passé en GA ?

Le 3 août 2026, via l'API Model Studio et la plateforme QwenWork. Les classements Arena Text #5 (1 496 pts provisoires) et Vision #2 ont été annoncés le même jour.

Les poids sont-ils open source ?

Pas au 4 août 2026. Alibaba a promis une publication Hugging Face / ModelScope la semaine suivant le GA — première open weights pour la classe Max — mais la livraison n'était pas effective.

Quelle est la tarification API ?

2,00 $ par million de tokens en entrée, 6,00 $ en sortie (Model Studio). Inférieur à Kimi K3 (3 $/15 $), à comparer avec les créneaux off-peak de DeepSeek V4-Pro pour les charges output-intensives.

Qwen3.8-Max ou Kimi K3 — lequel choisir ?

Pas de gagnant universel. Qwen excelle en multimodal et Arena texte chinois (#5) ; K3 domine Frontend Code Arena et dispose de poids complets depuis le 27 juillet. Le choix dépend du workload et de la capacité d'auto-hébergement.

Le score Arena #5 est-il fiable ?

Indicateur tiers utile, mais 1 496 points restent provisoires et sensibles au biais de vote. Ne pas les mélanger avec TerminalBench ou PaperBench (mesures Alibaba) — tests A/B internes obligatoires.

Qu'est-ce que QwenWork ?

Plateforme agent bureautique Alibaba (千问办公) propulsée par Qwen3.8-Max : documents, tableurs, recherche et tâches d'ingénierie longue durée. Canal distinct de l'API Model Studio.

Lien avec Apple Intelligence en Chine ?

Les appareils Chine utilisent Qwen pour la génération (enregistrement CAC). Qwen3.8-Max GA est un candidat à la montée en capacité ; le calendrier iOS relève d'Apple. Voir notre dossier Apple Intelligence Chine.