Wer im August 2026 ein chinesisches Frontier-LLM für Produktion evaluiert, bekommt mit Qwen3.8-Max frische Zahlen — und gleichzeitig eine Datenlücke. Alibaba hat am 3. August 2026 die GA-Version freigegeben: 2,4 Billionen Gesamtparameter, 95B aktive MoE pro Request, 1M Kontext, API $2/$6 pro Million Tokens. Arena Text rangiert vorläufig auf Platz 5 (1.496 Punkte), Vision auf Platz 2. Doch die versprochenen Gewichte für nächste Woche fehlen am Stichtag — und sämtliche Leistungsclaims stammen bis auf Arena aus Anbieter-eigenen Benchmarks. Dieser datengetriebene Leitfaden liefert Entscheidungsmatrizen, DSGVO-Einschätzungen für Cloud-Prompts, den Vergleich zu Kimi K3 und DeepSeek V4 sowie sechs Schritte vor dem Rollout.
SECTION 01 Fünf Kennzahlen-Lücken, die Evaluationsberichte verzerren
GA-Launches chinesischer Flaggschiffe folgen 2026 einem wiederkehrenden Muster: starke Headlines, verzögerte Gewichte, gemischte Benchmark-Quellen. Für EU-Teams mit DSGVO-Pflichten und dokumentationspflichtigen Beschaffungsprozessen sind diese fünf Punkte entscheidend:
- Gewichte versprochen, nicht geliefert: Alibaba kündigte Max-Klasse-erstmals Open Weights für die Woche nach dem 3. August an — am GA-Tag existieren nur API und QwenWork. Wer Self-Hosting unter Art. 28 AVV plant, kann noch keine Lizenz oder Shard-Größe prüfen.
- Vendor-Benchmarks vs. Arena: TerminalBench 86,6, PaperBench 93,0 und OSWorld-Verified 86,1 sind Alibaba-intern gemessen. Arena Text #5 (1.496 vorläufig) und Vision #2 sind Drittanbieter — beide Kategorien dürfen in RFPs nicht vermischt werden.
- 2,4T ≠ 95B aktiv: MoE-Gesamtgröße suggeriert Kimi-K3-Nähe (2,8T), tatsächlich feuern pro Request 95B Experten. Vergleiche ohne Aktivierungsspalte sind statistisch wertlos.
- 1M Kontext × $2/M Input: Theoretisch 1.048.576 Tokens — in Agent-Schleifen summiert sich die Rechnung schnell. Cloud-API mit personenbezogenen Inhalten löst DSGVO-Transferfragen aus; erst nach Gewicht-Freigabe reduziert EU-Self-Hosting das Risiko.
- QwenWork ≠ Apple Intelligence China: Das Büro-Agent-Produkt und der CAC-registrierte Qwen-Backend-Stack für China-iPhones teilen Marken, nicht Compliance-Pfade — getrennte DPIA erforderlich.
SECTION 02 GA-Zeitstrahl und harte Specs (Stand 3. August 2026)
| Datum | Ereignis |
|---|---|
| 2026-07-31 ca. | Preview in Alibaba Cloud Model Studio — Reaktion auf Kimi-K3-Open-Weights (27.07.) |
| 2026-08-03 | GA: Model Studio API + QwenWork global. Arena Text #5 (1.496 vorl.), Vision #2 veröffentlicht |
| 2026-08 Mitte (angekündigt) | Gewichte auf Hugging Face / ModelScope — Qwen3.8-27B parallel geplant; am 4.08. noch nicht shipped |
| Kennzahl | Wert | Quelle / Hinweis |
|---|---|---|
| Gesamtparameter | 2,4T | Größtes Qwen-Modell bisher |
| Aktive Parameter | 95B pro Request | Sparse MoE + Hybrid-Attention |
| Kontextfenster | 1.048.576 Tokens (~1M) | Output-Cap ~131K Tokens |
| Arena Text | #5, 1.496 Punkte (vorläufig) | Drittanbieter; höchster chinesischer Text-Rang |
| Arena Vision | #2 | Drittanbieter |
| Vendor-Benchmarks | TerminalBench 86,6 · PaperBench 93,0 · OSWorld 86,1 | Alibaba-intern — nicht unabhängig auditiert |
| API-Preis | Input $2,00 / Output $6,00 pro M Tokens | Model Studio Listpreis |
| Gewichte | Nicht veröffentlicht (4.08.) | Ankündigung „nächste Woche“ unerfüllt |
1496 Arena-Punkte und $2/$6 positionieren Qwen3.8-Max im mittleren Frontier-Preissegment — aber ohne Gewichte und ohne unabhängige Code-Benchmarks bleibt jede Beschaffungsentscheidung spekulativ.
SECTION 03 Entscheidungsmatrix: Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4-Pro
Alle drei Modelle werben mit 1M Kontext — die relevanten Unterscheidungsmerkmale für EU-Engineering-Teams liegen in Preis, Gewicht-Verfügbarkeit und Transparenz.
| Kriterium | Qwen3.8-Max | Kimi K3 | DeepSeek V4-Pro |
|---|---|---|---|
| Parameter gesamt / aktiv | 2,4T / 95B MoE | 2,8T / 16 Experten aktiv | 1,6T Dense |
| Gewichte | Ausstehend (Versprechen KW nach GA) | 27.07. Modified MIT, vollständig | 24.04. MIT Open Source |
| API Input/Output ($/M) | $2 / $6 | $3 / $15 (Cache $0,30) | Peak/Off-Peak (Output Off-Peak $0,87) |
| Drittanbieter-Rang | Arena Text #5 · Vision #2 | Intelligence Index 57,1 (#3/189) | SWE-bench Verified 80,6 % (OSS-Spitze) |
| Vendor-only Claims | TerminalBench, PaperBench, OSWorld | SWE-bench 93,4 % (eigene Messung) | Eigene Architektur-Benchmarks |
| DSGVO-Self-Host | Erst nach Gewicht-Release prüfbar | Modified MIT — AVV-freundlicher | MIT — etabliertes Self-Hosting |
| Stärke | Multimodal + Alibaba-Cloud-Integration | Open Weights + Coding-Agent | Kosteninferenz + Code |
Vertiefung: Kimi-K3-Review, OpenRouter Juli-Rankings, K3-Gewicht-Release.
SECTION 04 QwenWork, Apple Intelligence China und Transparenz-Kontroversen
Parallel zur GA startete Alibaba QwenWork (千问办公) — ein Büro-Agent für Präsentationen, Tabellen, Recherche und mehrstufige Software-Engineering-Demos (offiziell 16-Tage-Autonomieprojekte, 500+ Chip-Design-Schritte). Das ist ein SaaS-Produkt, keine reine API — Datenresidency und Log-Retention müssen im DPA geklärt werden.
Seit der CAC-Registrierung vom 15. Juli 2026 nutzt Apple Intelligence auf China-Geräten Qwen für Generierung, Baidu für Suche/Siri. Qwen3.8-Max ist ein logischer Capability-Kandidat für iOS 27 — der Integrationszeitplan liegt bei Apple, nicht bei Alibaba. Cross-Border-Apps brauchen getrennte Test-Matrizen für globales vs. China-Backend.
| Thema | Status | Auswirkung auf Beschaffung |
|---|---|---|
| Open-Weights-Versprechen | „Nächste Woche“ — am 4.08. nicht eingetroffen | Self-Host-TCO und DSGVO-Pfad unklar |
| Benchmark-Herkunft | Leistungs-Spitzenwerte vendor-run | RFPs brauchen unabhängige Reproduktion |
| Preview→GA-Delta | Community erwartete sofortige HF-Uploads | Vertrauens- und SEO-„Open Source“-Verwirrung |
| Arena-Vorläufigkeit | 1.496 Punkte nicht final | Kein alleiniges KPI für Vertragsabschluss |
SECTION 05 Sechs Schritte vor dem Qwen3.8-Max-Rollout und zitierbare Daten
- Gewicht-Release im Kalender blocken: Bis Hugging Face / ModelScope live sind, intern „API-only“ dokumentieren — keine Self-Host-Zusagen an Stakeholder.
- Benchmark-Quellen trennen: Arena-Zeilen (Text #5, Vision #2) von Alibaba-TerminalBench/PaperBench in Evaluations-Tabellen splitten; Messdatum und Harness notieren.
- DSGVO-Check für Cloud-Prompts: Personenbezogene Inhalte über Model Studio erfordern AVV, Transferimpact Assessment und ggf. Pseudonymisierung — erst Open Weights ermöglichen EU-On-Prem ohne Drittlandtransfer.
- 1M-Kontext-Kosten simulieren: Repräsentative Agent-Loops gegen $2/$6 rechnen; Fallback über OpenRouter einplanen.
- A/B gegen K3 und V4: Gleiche Prompt-Sets für Frontend-Code, Langdokumente und Vision — K3 hat Gewichte, Qwen nur API: Bedingungen explizit machen.
- Transparenz-Risiken im Protokoll: Unerfülltes Gewicht-Versprechen und vendor-only Benchmarks in Beschaffungsnotizen festhalten — verhindert Overcommit an Führungsebene.
- Build-Schicht separieren: Kein LLM ersetzt Xcode-Signierung — M4-Cloud-Physik für iOS CI/CD parallel planen.
- Parameter: 2,4T gesamt / 95B aktiv (MoE)
- Kontext: 1M Input · ~131K Output
- Arena: Text #5 (1.496 vorl.) · Vision #2
- API: $2 / $6 pro M Tokens
- Gewichte: 4.08.2026 nicht shipped; Ankündigung HF/ModelScope
- Konkurrenz-API: K3 $3/$15 · V4-Pro Off-Peak Output $0,87/M
Primärquellen — nach Updates erneut prüfen:
Alibaba Cloud — Qwen3.8-Max GA Pressemitteilung
Alibaba Cloud Model Studio — API-Dokumentation
Arena.ai — Text / Vision Leaderboards
Qwen3.8-Max liefert messbare Frontier-Signale — Arena Text #5, Vision #2, $2/$6 — aber fehlende Gewichte, vendor-run Benchmarks und DSGVO-Cloud-Pflichten bremsen sofortige EU-Vollrollouts. Praxisnahes Setup: Model Studio für Langkontext-Inferenz und QwenWork-Piloten, VPSNIX M4/M4-Pro-Physikknoten für native Apple-Silicon-Builds — 100 % Original-Hardware, voller Root, null Hypervisor-Overhead. Preise prüfen und Agent-Workloads auf complianten Physikumgebungen verankern.
SECTION 06 FAQ
Wann wurde Qwen3.8-Max GA veröffentlicht?
Am 3. August 2026 über Alibaba Cloud Model Studio API und QwenWork. Arena Text #5 (1.496 vorläufig) und Vision #2 wurden am selben Tag kommuniziert.
Sind die Modellgewichte bereits Open Source?
Nein — Stand 4. August 2026 nicht auf Hugging Face oder ModelScope. Alibaba kündigte Max-Klasse-erstmals Open Weights für die Woche nach GA an; die Frist ist noch nicht erfüllt.
Was kostet die API?
Listpreis Model Studio: Input $2,00 und Output $6,00 pro Million Tokens — günstiger als Kimi K3 ($3/$15), teurer als DeepSeek V4-Pro Off-Peak für Output-intensive Workloads.
Ist Arena Text #5 verlässlich?
Als Drittanbieter-Indikator nützlich, aber 1.496 Punkte sind vorläufig und unterliegen Voting-Bias. Nicht mit Alibaba-internen TerminalBench-Werten vermischen — eigene A/B-Tests sind Pflicht.
DSGVO: Darf ich Produktions-Prompts über die Cloud-API senden?
Nur mit AVV, dokumentiertem Zweck und Transferimpact Assessment. Personenbezogene Daten sollten pseudonymisiert oder on-prem inferiert werden — erst nach Gewicht-Freigabe realistisch in EU-Rechenzentren.
Was ist QwenWork?
Alibabas Büro-Agent-Plattform (千问办公) mit Qwen3.8-Max als Backend — für Dokumente, Tabellen und langfristige Engineering-Tasks. Separate Compliance-Anforderungen gegenüber reiner API-Integration.
Zusammenhang mit Apple Intelligence in China?
China-Geräte nutzen Qwen für Generierung (CAC-registriert). Qwen3.8-Max GA ist ein Capability-Update-Kandidat; iOS-Integrationszeitplan liegt bei Apple. Details: Apple Intelligence China.