Startseite / Blog / Qwen3.8-Max
ENGINEERING_BLOG · 2026.08.04

Qwen3.8-Max GA: Arena Text #5 bei $2/$6 — Gewichte stehen noch aus

QWEN3.8-MAX · Arena Text (vorläufig)
#5

1.496 Punkte vorläufig · 2,4T gesamt / 95B aktiv · Vision Arena #2 · GA 3. August 2026

Wer im August 2026 ein chinesisches Frontier-LLM für Produktion evaluiert, bekommt mit Qwen3.8-Max frische Zahlen — und gleichzeitig eine Datenlücke. Alibaba hat am 3. August 2026 die GA-Version freigegeben: 2,4 Billionen Gesamtparameter, 95B aktive MoE pro Request, 1M Kontext, API $2/$6 pro Million Tokens. Arena Text rangiert vorläufig auf Platz 5 (1.496 Punkte), Vision auf Platz 2. Doch die versprochenen Gewichte für nächste Woche fehlen am Stichtag — und sämtliche Leistungsclaims stammen bis auf Arena aus Anbieter-eigenen Benchmarks. Dieser datengetriebene Leitfaden liefert Entscheidungsmatrizen, DSGVO-Einschätzungen für Cloud-Prompts, den Vergleich zu Kimi K3 und DeepSeek V4 sowie sechs Schritte vor dem Rollout.

SECTION 01 Fünf Kennzahlen-Lücken, die Evaluationsberichte verzerren

GA-Launches chinesischer Flaggschiffe folgen 2026 einem wiederkehrenden Muster: starke Headlines, verzögerte Gewichte, gemischte Benchmark-Quellen. Für EU-Teams mit DSGVO-Pflichten und dokumentationspflichtigen Beschaffungsprozessen sind diese fünf Punkte entscheidend:

  • Gewichte versprochen, nicht geliefert: Alibaba kündigte Max-Klasse-erstmals Open Weights für die Woche nach dem 3. August an — am GA-Tag existieren nur API und QwenWork. Wer Self-Hosting unter Art. 28 AVV plant, kann noch keine Lizenz oder Shard-Größe prüfen.
  • Vendor-Benchmarks vs. Arena: TerminalBench 86,6, PaperBench 93,0 und OSWorld-Verified 86,1 sind Alibaba-intern gemessen. Arena Text #5 (1.496 vorläufig) und Vision #2 sind Drittanbieter — beide Kategorien dürfen in RFPs nicht vermischt werden.
  • 2,4T ≠ 95B aktiv: MoE-Gesamtgröße suggeriert Kimi-K3-Nähe (2,8T), tatsächlich feuern pro Request 95B Experten. Vergleiche ohne Aktivierungsspalte sind statistisch wertlos.
  • 1M Kontext × $2/M Input: Theoretisch 1.048.576 Tokens — in Agent-Schleifen summiert sich die Rechnung schnell. Cloud-API mit personenbezogenen Inhalten löst DSGVO-Transferfragen aus; erst nach Gewicht-Freigabe reduziert EU-Self-Hosting das Risiko.
  • QwenWork ≠ Apple Intelligence China: Das Büro-Agent-Produkt und der CAC-registrierte Qwen-Backend-Stack für China-iPhones teilen Marken, nicht Compliance-Pfade — getrennte DPIA erforderlich.

SECTION 02 GA-Zeitstrahl und harte Specs (Stand 3. August 2026)

Qwen3.8-Max — Meilensteine
Datum Ereignis
2026-07-31 ca. Preview in Alibaba Cloud Model Studio — Reaktion auf Kimi-K3-Open-Weights (27.07.)
2026-08-03 GA: Model Studio API + QwenWork global. Arena Text #5 (1.496 vorl.), Vision #2 veröffentlicht
2026-08 Mitte (angekündigt) Gewichte auf Hugging Face / ModelScope — Qwen3.8-27B parallel geplant; am 4.08. noch nicht shipped
Modell-Spezifikationen Qwen3.8-Max
Kennzahl Wert Quelle / Hinweis
Gesamtparameter 2,4T Größtes Qwen-Modell bisher
Aktive Parameter 95B pro Request Sparse MoE + Hybrid-Attention
Kontextfenster 1.048.576 Tokens (~1M) Output-Cap ~131K Tokens
Arena Text #5, 1.496 Punkte (vorläufig) Drittanbieter; höchster chinesischer Text-Rang
Arena Vision #2 Drittanbieter
Vendor-Benchmarks TerminalBench 86,6 · PaperBench 93,0 · OSWorld 86,1 Alibaba-intern — nicht unabhängig auditiert
API-Preis Input $2,00 / Output $6,00 pro M Tokens Model Studio Listpreis
Gewichte Nicht veröffentlicht (4.08.) Ankündigung „nächste Woche“ unerfüllt

1496 Arena-Punkte und $2/$6 positionieren Qwen3.8-Max im mittleren Frontier-Preissegment — aber ohne Gewichte und ohne unabhängige Code-Benchmarks bleibt jede Beschaffungsentscheidung spekulativ.

SECTION 03 Entscheidungsmatrix: Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4-Pro

Alle drei Modelle werben mit 1M Kontext — die relevanten Unterscheidungsmerkmale für EU-Engineering-Teams liegen in Preis, Gewicht-Verfügbarkeit und Transparenz.

Frontier-Vergleich China (August 2026)
Kriterium Qwen3.8-Max Kimi K3 DeepSeek V4-Pro
Parameter gesamt / aktiv 2,4T / 95B MoE 2,8T / 16 Experten aktiv 1,6T Dense
Gewichte Ausstehend (Versprechen KW nach GA) 27.07. Modified MIT, vollständig 24.04. MIT Open Source
API Input/Output ($/M) $2 / $6 $3 / $15 (Cache $0,30) Peak/Off-Peak (Output Off-Peak $0,87)
Drittanbieter-Rang Arena Text #5 · Vision #2 Intelligence Index 57,1 (#3/189) SWE-bench Verified 80,6 % (OSS-Spitze)
Vendor-only Claims TerminalBench, PaperBench, OSWorld SWE-bench 93,4 % (eigene Messung) Eigene Architektur-Benchmarks
DSGVO-Self-Host Erst nach Gewicht-Release prüfbar Modified MIT — AVV-freundlicher MIT — etabliertes Self-Hosting
Stärke Multimodal + Alibaba-Cloud-Integration Open Weights + Coding-Agent Kosteninferenz + Code

Vertiefung: Kimi-K3-Review, OpenRouter Juli-Rankings, K3-Gewicht-Release.

SECTION 04 QwenWork, Apple Intelligence China und Transparenz-Kontroversen

Parallel zur GA startete Alibaba QwenWork (千问办公) — ein Büro-Agent für Präsentationen, Tabellen, Recherche und mehrstufige Software-Engineering-Demos (offiziell 16-Tage-Autonomieprojekte, 500+ Chip-Design-Schritte). Das ist ein SaaS-Produkt, keine reine API — Datenresidency und Log-Retention müssen im DPA geklärt werden.

Seit der CAC-Registrierung vom 15. Juli 2026 nutzt Apple Intelligence auf China-Geräten Qwen für Generierung, Baidu für Suche/Siri. Qwen3.8-Max ist ein logischer Capability-Kandidat für iOS 27 — der Integrationszeitplan liegt bei Apple, nicht bei Alibaba. Cross-Border-Apps brauchen getrennte Test-Matrizen für globales vs. China-Backend.

Transparenz-Risiko-Register (August 2026)
Thema Status Auswirkung auf Beschaffung
Open-Weights-Versprechen „Nächste Woche“ — am 4.08. nicht eingetroffen Self-Host-TCO und DSGVO-Pfad unklar
Benchmark-Herkunft Leistungs-Spitzenwerte vendor-run RFPs brauchen unabhängige Reproduktion
Preview→GA-Delta Community erwartete sofortige HF-Uploads Vertrauens- und SEO-„Open Source“-Verwirrung
Arena-Vorläufigkeit 1.496 Punkte nicht final Kein alleiniges KPI für Vertragsabschluss

SECTION 05 Sechs Schritte vor dem Qwen3.8-Max-Rollout und zitierbare Daten

  1. Gewicht-Release im Kalender blocken: Bis Hugging Face / ModelScope live sind, intern „API-only“ dokumentieren — keine Self-Host-Zusagen an Stakeholder.
  2. Benchmark-Quellen trennen: Arena-Zeilen (Text #5, Vision #2) von Alibaba-TerminalBench/PaperBench in Evaluations-Tabellen splitten; Messdatum und Harness notieren.
  3. DSGVO-Check für Cloud-Prompts: Personenbezogene Inhalte über Model Studio erfordern AVV, Transferimpact Assessment und ggf. Pseudonymisierung — erst Open Weights ermöglichen EU-On-Prem ohne Drittlandtransfer.
  4. 1M-Kontext-Kosten simulieren: Repräsentative Agent-Loops gegen $2/$6 rechnen; Fallback über OpenRouter einplanen.
  5. A/B gegen K3 und V4: Gleiche Prompt-Sets für Frontend-Code, Langdokumente und Vision — K3 hat Gewichte, Qwen nur API: Bedingungen explizit machen.
  6. Transparenz-Risiken im Protokoll: Unerfülltes Gewicht-Versprechen und vendor-only Benchmarks in Beschaffungsnotizen festhalten — verhindert Overcommit an Führungsebene.
  7. Build-Schicht separieren: Kein LLM ersetzt Xcode-Signierung — M4-Cloud-Physik für iOS CI/CD parallel planen.
  • Parameter: 2,4T gesamt / 95B aktiv (MoE)
  • Kontext: 1M Input · ~131K Output
  • Arena: Text #5 (1.496 vorl.) · Vision #2
  • API: $2 / $6 pro M Tokens
  • Gewichte: 4.08.2026 nicht shipped; Ankündigung HF/ModelScope
  • Konkurrenz-API: K3 $3/$15 · V4-Pro Off-Peak Output $0,87/M

Primärquellen — nach Updates erneut prüfen:

Alibaba Cloud — Qwen3.8-Max GA Pressemitteilung

Alibaba Cloud Model Studio — API-Dokumentation

Arena.ai — Text / Vision Leaderboards

Qwen3.8-Max liefert messbare Frontier-Signale — Arena Text #5, Vision #2, $2/$6 — aber fehlende Gewichte, vendor-run Benchmarks und DSGVO-Cloud-Pflichten bremsen sofortige EU-Vollrollouts. Praxisnahes Setup: Model Studio für Langkontext-Inferenz und QwenWork-Piloten, VPSNIX M4/M4-Pro-Physikknoten für native Apple-Silicon-Builds — 100 % Original-Hardware, voller Root, null Hypervisor-Overhead. Preise prüfen und Agent-Workloads auf complianten Physikumgebungen verankern.

SECTION 06 FAQ

Wann wurde Qwen3.8-Max GA veröffentlicht?

Am 3. August 2026 über Alibaba Cloud Model Studio API und QwenWork. Arena Text #5 (1.496 vorläufig) und Vision #2 wurden am selben Tag kommuniziert.

Sind die Modellgewichte bereits Open Source?

Nein — Stand 4. August 2026 nicht auf Hugging Face oder ModelScope. Alibaba kündigte Max-Klasse-erstmals Open Weights für die Woche nach GA an; die Frist ist noch nicht erfüllt.

Was kostet die API?

Listpreis Model Studio: Input $2,00 und Output $6,00 pro Million Tokens — günstiger als Kimi K3 ($3/$15), teurer als DeepSeek V4-Pro Off-Peak für Output-intensive Workloads.

Ist Arena Text #5 verlässlich?

Als Drittanbieter-Indikator nützlich, aber 1.496 Punkte sind vorläufig und unterliegen Voting-Bias. Nicht mit Alibaba-internen TerminalBench-Werten vermischen — eigene A/B-Tests sind Pflicht.

DSGVO: Darf ich Produktions-Prompts über die Cloud-API senden?

Nur mit AVV, dokumentiertem Zweck und Transferimpact Assessment. Personenbezogene Daten sollten pseudonymisiert oder on-prem inferiert werden — erst nach Gewicht-Freigabe realistisch in EU-Rechenzentren.

Was ist QwenWork?

Alibabas Büro-Agent-Plattform (千问办公) mit Qwen3.8-Max als Backend — für Dokumente, Tabellen und langfristige Engineering-Tasks. Separate Compliance-Anforderungen gegenüber reiner API-Integration.

Zusammenhang mit Apple Intelligence in China?

China-Geräte nutzen Qwen für Generierung (CAC-registriert). Qwen3.8-Max GA ist ein Capability-Update-Kandidat; iOS-Integrationszeitplan liegt bei Apple. Details: Apple Intelligence China.