Startseite / Blog / Preiskampf
ENGINEERING_BLOG · 2026.08.17

DeepSeek-API um bis zu 1.100 % teurer — unmittelbar nach Chinas Open-Weight-Offensive

V4-PRO · PEAK CACHE-HIT INPUT
1.100%

Wirksam 00:00 Uhr Peking-Zeit am 17. August. Die Schlagzeile gilt nur für Peak-Cache-Hit-Input, nicht für die Gesamtrechnung.

Wer DeepSeek-, Qwen- oder GLM-APIs abrechnet, sieht drei Schritte, die sich auf den ersten Blick widersprechen. DeepSeek zieht einzelne Tarifzeilen um bis zu 1.100 % an. Alibaba legt in derselben Woche ein 2,4-Billionen-Parameter-Flaggschiff offen, das zuvor nie als Gewichtssatz erschien. Zhipu liefert GLM-5.3 und steigert Coding-Benchmarks um rund das Sechsfache — ohne das Basismodell neu zu trainieren. Die belastbare Lesart: Chinesische Labs konkurrieren nicht mehr allein über den Listenpreis, sondern über Preissetzungsmacht. Dieser Beitrag liefert Timeline, Tarifkarte, drei Strategien, einen direkten Preisvergleich, ungeprüfte Behauptungen und eine Sechs-Schritte-Checkliste.

SECTION 01 Vier Fehlschlüsse vor dem Zitat der 1.100-Prozent-Erhöhung

  • Die Schlagzeile ist eine Abrechnungszeile, keine Rechnung: „11ד, „über 1.100 %“ und „350 %“ sind alle korrekt. Sie treffen Peak-Cache-Hit-Input, Output und Cache-Miss-Input. Output (350 %) und Cache-Miss-Input bewegen reale Rechnungen stärker als die fast kostenlose Cache-Hit-Stufe.
  • Peak-Fenster laufen nach Peking-Zeit: 9–12 Uhr und 14–18 Uhr. Der Rest ist Off-Peak zum halben Peak-Satz. Die Mitteilung fordert Lastverschiebung, nicht nur Budgetanpassung.
  • Open Weights ist nicht Apache 2.0: Qwen3.8-Max nutzt eine eigene Lizenz. Ein Model-as-a-Service- oder AI-Work-Assistant-Geschäft über 50 Mio. USD in einem 12-Monats-Fenster braucht einen separaten kommerziellen Vertrag. Behauptungen, Nutzer in den USA, der EU, dem Vereinigten Königreich oder Korea dürften die Gewichte nicht laden, sind falsch.
  • GLM-5.3 ist keine neue Basis: Dieselben 743B Parameter wie GLM-5.2. Die Zugewinne stammen aus skaliertem Post-Training-RL. Die Werte sind Herstellerangaben; ein unabhängiger Re-Run ist öffentlich noch nicht belegt. Vorarbeiten: DeepSeek V4 GA und Peak-Tal-Tarife, Qwen3.8-Max-Launch im Überblick.

SECTION 02 Zeitachse: Was erschien — und wann der Preis wirklich wechselte

Juli–August 2026 · Open-Weight- und Preis-Timeline
Datum Ereignis
16. Juli 2026 Moonshot AI legt Kimi K3 offen (2,8T Parameter); US-Sicherheitsdebatte folgt
30. Juli 2026 OpenAI senkt GPT-5.6 Luna um 80 %
2.–3. August 2026 Alibaba zeigt Qwen3.8-Max zuerst als Preview, dann als gehostete API
6.–7. August 2026 OpenAI macht Luna zum kostenlosen Default mit unbegrenzten Textchats
10. August 2026 Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für das Flaggschiff Muse Spark 1.2 an
12. August 2026 Alibaba stellt Qwen3.8-2.4T-A95B auf Hugging Face / ModelScope; xAI liefert Grok 4.6
13. August 2026 DeepSeek-V4-Pro geht GA und kündigt die Preiserhöhung zum 17. August an; Google liefert vergünstigtes Gemini 3.7 Flash
14. August 2026 Zhipu liefert GLM-5.3 auf der 743B-Basis von GLM-5.2
17. August 2026, 00:00 Peking Die neuen DeepSeek-Tarife gelten

Im Überblick: Während chinesische Labs Preise anheben und Flaggschiff-Gewichte öffnen, senken US-Labs Preise und gehen auf der Consumer-Schicht auf Free. Das sind zwei Seiten desselben Wettbewerbs. Zur OpenAI-Senkung: GPT-5.6 Luna / Terra / Sol Preissenkung.

SECTION 03 Kennzahlen: DeepSeek-Stufen, Qwen-Specs, GLM nur Post-Training

Die neuen DeepSeek-Sätze gelten ab 00:00 Uhr Peking-Zeit am 17. August. Peak-Stunden: 9–12 Uhr und 14–18 Uhr Peking-Zeit. Alle folgenden Beträge sind RMB je 1 Mio. Tokens, abgeglichen mit der offiziellen Mitteilung und mehreren Berichten.

DeepSeek-Preiserhöhung nach Stufe (RMB je 1 Mio. Tokens)
Abrechnungsposition Alter Preis Neu Off-Peak Neu Peak Peak-Anstieg
V4-Flash Cache-Hit (Input) ¥0,02 ¥0,05 ¥0,10 ~400 %
V4-Flash Cache-Miss (Input) ¥1,0 ¥1,5 ¥3,0 200 %
V4-Flash Output ¥2,0 ¥4,5 ¥9,0 350 %
V4-Pro Cache-Hit (Input) ¥0,025 ¥0,15 ¥0,30 ~1.100 %
V4-Pro Cache-Miss (Input) ¥3,0 ¥4,5 ¥9,0 200 %
V4-Pro Output ¥6,0 ¥13,5 ¥27,0 350 %

Die 1.100 % gelten für Peak-Cache-Hit-Input — die Stufe, die zuvor am nächsten bei null lag. Output, der die meisten realen Rechnungen dominiert, stieg um 350 %. Eine unabhängige Modellierung einer laststarken Off-Peak-Last mit etwa 50 % Cache-Hit landet näher bei 1,8×.

Qwen3.8-2.4T-A95B (Qwen3.8-Max Open Weights)
Spezifikation Angabe
Parameter 2,4T gesamt, 95B aktiv je Token (MoE, 512 Experts, 10 geroutet + 1 shared)
Kontextfenster 262.144 Tokens nativ (offener Checkpoint), erweiterbar auf ~1,01M; gehostetes Max default 1M
Release-Takt Preview 2. August → API live 3. August → Open Weights 12. August
API-Preis (international) $2/M Input, $6/M Output
Lizenz Nicht Apache 2.0 — eigene Qwen3.8-Max License
Warum das zählt Erstmals legt Alibaba ein Max-Flaggschiff als Gewichtssatz offen; Qwen3.5 / 3.6 / 3.7 Max blieben API-only
GLM-5.3 vs. GLM-5.2: gleiche Basis, nur Post-Training (Zhipu-Selbstangabe)
Benchmark GLM-5.2 GLM-5.3 Delta
Terminal-Bench 3.0 4,6 % 28,3 % +23,7 Punkte
DeepSWE v1.1 46,2 % 66,9 % +20,7 Punkte
Agents' Last Exam (CLI) 23,8 % 28,5 % +4,7 Punkte
CyberGym 77,2 % 84,5 % +7,3 Punkte
AutomationBench 26,2 % 48,2 % +22,0 Punkte

Das sind Zhipu-eigene Zahlen. Ein unabhängiger Dritt-Re-Run ist nicht veröffentlicht. GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %). Es ist ein starkes Open-Weight-Ergebnis, kein Frontier-Sieg.

SECTION 04 Drei Strategien: Peak-Tal-Tarif, Custom-Lizenz, Post-Training-Skalierung

DeepSeek: Kapazitätsengpass, keine Strategiekehrtwende

Die bequeme Lesart lautet: „Chinas günstigstes Modell gibt dem Margendruck nach.“ Die Tarifstruktur spricht für das Gegenteil: Rechenengpässe werden auf dem Preisblatt sichtbar. Ein flacher, dauerhaft niedriger Satz funktionierte als Akquise, solange die GPU-Zufuhr mithielt. Sobald die Nutzung exponentiell wuchs und die Kapazität nicht, musste etwas explizit werden. „Flexiblere Lastplanung anregen“ heißt betrieblich: Peak-Compute ist knapp — verschieben Sie die Last selbst.

Ein Punkt, den die internationale Berichterstattung oft übergeht: Zur Peak-Zeit liegt die offizielle DeepSeek-API nun über mehreren Drittanbieter-Resellern (GMI Cloud, Novita und andere listen V4 Pro weiter unter dem neuen offiziellen Peak). Die Annahme, die Hersteller-API sei stets der günstigste Weg zu DeepSeek, gilt erstmals nicht mehr.

Alibaba: Gewichte für Mindshare, Lizenz für die Umsatzdecke

Alibaba macht zwei Dinge gleichzeitig. Der vollständige 2,4T-Checkpoint steht zum kostenlosen Download. Gleichzeitig gilt eine eigene Lizenz — nicht das Apache 2.0 der kleineren Qwen-Modelle. Jedes Model-as-a-Service- oder AI-Work-Assistant-Geschäft mit mehr als 50 Mio. USD Umsatz in einem beliebigen 12-Monats-Zeitraum muss eine separate kommerzielle Lizenz verhandeln. Produkte mit über 100 Mio. monatlich aktiven Nutzern oder über 20 Mio. USD Monatsumsatz müssen den Modellnamen prominent zeigen.

Gewichte verschenken, um Entwickler zu gewinnen, besonders international. Hebel behalten gegenüber den wenigen Firmen, die darauf ein konkurrierendes Inferenzgeschäft bauen können. Das ist eine andere Wette als Metas Muse Glimmer unter uneingeschränktem Apache 2.0. Behauptungen, die Lizenz verbiete Downloads aus den USA, der EU, dem Vereinigten Königreich und Südkorea, sind falsch. Der veröffentlichte Text enthält keine geografische Klausel.

GLM-5.3: keine neue Basis — die Methode ist die Nachricht

Dieselbe 743B-Parameter-Basis wie GLM-5.2. Kein Retraining. Ein Sprung um rund das Sechsfache auf Terminal-Bench 3.0 (4,6 % → 28,3 %) durch Skalierung der Reinforcement-Learning-Umgebungen im Post-Training. Während Pretraining-Skalierungsgesetze abnehmende Erträge zeigen, wird Post-Training-RL zu einem eigenen Hebel mit deutlich niedrigerer Kostenschwelle als das Neutrainieren eines Foundation-Modells. Labs ohne OpenAI-Compute-Skala können den Abstand bei agentischen und Coding-Benchmarks trotzdem verkürzen.

deepseek-v4-pro-cny-per-1m.txt
V4-Pro  per 1M tokens  CNY  (Beijing peak 09-12 / 14-18)
off-peak  cache-hit 0.15   miss 4.5   out 13.5
peak      cache-hit 0.30   miss 9.0   out 27.0
headline  ~1100% = peak cache-hit input only

SECTION 05 Direktvergleich: Ist DeepSeek noch das günstigste Frontier-Modell?

Input / Output je 1 Mio. Tokens
Modell Input Output Open Weights?
DeepSeek V4-Pro (Peak) ¥9,0 (~$1,26) ¥27,0 (~$3,78) Nein
DeepSeek V4-Pro (Off-Peak) ¥4,5 (~$0,63) ¥13,5 (~$1,89) Nein
Qwen3.8-Max (internationale API) $2,00 $6,00 Ja (Custom-Lizenz)
OpenAI GPT-5.6 Luna $0,20 $1,20 Nein
Claude Opus 5 (impliziert, laut Alibaba-Verhältnis) ~$5,00 ~$25,00 Nein

RMB zu USD bei etwa ¥7,15/$1, gerundet. Off-Peak-V4-Pro liegt weiter klar unter Claude Opus 5, ist aber nicht mehr die eindeutig günstigste Option. Die internationale Qwen3.8-Max-API und OpenAIs Luna unterbieten DeepSeeks Off-Peak-Satz. „Chinesisches Modell = günstigstes Modell“ hielt den Großteil von 2025 und Anfang 2026. Das ist keine sichere Annahme mehr.

SECTION 06 Was umstritten oder ungeprüft bleibt

  • Die 1.100-Prozent-Schlagzeile ist korrekt und ohne Kontext irreführend. Sie gilt nur für Peak-Cache-Hit-Input. Output — die Kostenposition, die die meisten realen Rechnungen dominiert — stieg um 350 %.
  • Behauptungen, Qwen3.8-Max laufe auf Alibabas hauseigenen Zhenwu-M890-Chips (und „Pangu-AL128“-Supernodes), berichtet von mehreren chinesischen Finanzmedien, sind weder durch Alibaba-Technikdokumentation noch durch Dritt-Benchmarks unabhängig bestätigt. Als vendor-nah, ungeprüft behandeln.
  • Die gemeldete Entdeckung einer „schweren Schwachstelle“ in Cursor durch GLM-5.3 stammt von VentureBeat und Zhipus eigener Offenlegung. Technische Details sind nicht öffentlich. Als herstellerseitig, nicht unabhängig auditiert lesen.
  • Berichte, Chinas Handelsministerium bereite Vergeltungs-Exportkontrollen für KI- und Halbleitertechnik vor, sind spekulativ und stützen sich auf unbestätigte Medienberichte, nicht auf eine amtliche Mitteilung.

SECTION 07 Warum das zählt: zwei Preiskämpfe parallel

Im vergangenen Monat haben Chinas führende Labs in einem Takt geliefert, den inländische Finanzmedien als „drei Modellupdates pro Woche“ bezeichnen. DeepSeek, Alibaba und Zhipu sitzen auf Moonshots Kimi K3 (Open Weights 16. Juli, 2,8T) und MiniMax H3. Die chinesische Berichterstattung rahmt das als Open-Weight-Releases, die eine globale Neubewertung der Branche erzwingen — bestimmter als die meisten englischsprachigen Produktnotizen. Hintergrund zu Kimi K3: Kimi K3 vollständige Open-Weight-Freigabe.

US-Labs fahren auf der Consumer-Schicht das Gegenteil. OpenAI senkte die günstigste Stufe am 30. Juli um 80 % und machte das Modell eine Woche später kostenlos und unbegrenzt. Google lieferte am 13. August ein coding-fokussiertes Modell zum halben Preis des drei Wochen alten Vorgängers. Chinesische Labs öffnen Flaggschiff-Gewichte und führen gestufte, höhere Preise am compute-knappen oberen Ende ein. US-Labs rennen am Consumer-Ende Richtung Free und Cheap. Beides ist real. Sie optimieren verschiedene Teile des Trichters.

Es gibt zudem eine geopolitische Schicht, die vorsichtig zu benennen ist. Moonshots Kimi K3 zog bereits US-Sicherheitsaufmerksamkeit. Einige Analysten lesen Alibabas Wahl dieses Fensters für ein 2,4T-Flaggschiff als Versuch, internationalen Mindshare und eine „technologische Parität“-Erzählung festzuziehen, bevor mögliche regulatorische Verengung greift. Das ist eine informierte Interpretation, kein bestätigter Fakt — und leicht zu übersehen, wenn man nur englischsprachige Technikpresse liest, die diese Schritte als isolierte Produktnews behandelt.

SECTION 08 Sechs Prüfschritte: die Erhöhung gegen die eigene Rechnung lesen

  1. Schlagzeile zerlegen, bevor Sie die Rechnung multiplizieren. Cache-Hit-Input, Cache-Miss-Input und Output sind getrennte Zeilen. Wenden Sie 1.100 % nicht auf den ganzen Monat an.
  2. Traffic auf Peking-Peak-Fenster mappen. 9–12 Uhr und 14–18 Uhr Peking-Zeit rechnen Peak. Batch-Evals, Offline-Destillation und nächtliches Agent-Replay gehören ins Off-Peak.
  3. Mit der realen Cache-Hit-Rate schätzen. Schwere Nutzer mit hoher Hit-Rate und überwiegend Off-Peak-Last wurden um 1,8× modelliert. Peak plus niedrige Hit-Rate ist das, was sich der Schlagzeile nähert.
  4. Die Qwen3.8-Max-Lizenzdatei lesen, nicht den Ankündigungsthread. Persönliche und interne Nutzung bleiben weitgehend unberührt. MaaS- / AI-Work-Assistant-Umsatz über 50 Mio. USD in einem beliebigen 12-Monats-Zeitraum braucht eine separate kommerzielle Lizenz. 100 Mio.+ MAU oder 20 Mio.+ USD Monatsumsatz erfordern prominente Modellnamensnennung. Kein geografisches Verbot.
  5. GLM-5.3-Vendor-Scores von Dritt-Re-Runs trennen. 4,6 % → 28,3 % auf Terminal-Bench 3.0 ist Selbstangabe. Schreiben Sie nicht „Frontier-Sieg“, solange kein unabhängiger Re-Run vorliegt.
  6. Ungeprüfte Claims auf ein separates Blatt legen. Zhenwu M890 / Pangu AL128, die Cursor-Schwachstelle und Exportkontroll-Gerüchte sind keine bestätigten Fakten. Sensible Evals und Off-Peak-Experimente, die kontrollierten Egress und Root brauchen, gehören auf einen isolierten physischen Knoten, nicht in eine geteilte Cloud-Session. Werden Aufrufprotokolle und Rechnungsdaten in der Cloud verarbeitet, handelt es sich um personenbezogene Daten im Sinne der DSGVO: Zweckbindung, Auftragsverarbeitung und Speicherort müssen vor dem Routing festliegen.

SECTION 09 Zitierfähige Kennzahlen und Primärquellen

  • V4-Pro Peak-Cache-Hit-Input: ¥0,025 → ¥0,30, ~1.100 %; Output ¥6,0 → ¥27,0, 350 %
  • Qwen3.8-2.4T-A95B: 2,4T gesamt / 95B aktiv; 262K nativ, ~1,01M erweiterbar; internationale API $2 / $6
  • GLM-5.3 Terminal-Bench 3.0: 4,6 % → 28,3 % (+23,7), gleiche 743B-Basis, kein Retraining; Herstellerangabe
  • Lizenzschwellen: 50 Mio. USD / 12 Monate MaaS oder AI Work Assistant braucht eine separate Lizenz; 100 Mio. MAU oder 20 Mio. USD Monatsumsatz braucht prominente Namensnennung

Offizielle und Drittquellen unten. Prüfen Sie die jeweils aktuelle offizielle Preis- und Lizenzlage, bevor Sie nachdrucken. Die oben als ungeprüft markierten Punkte (inländische Chip-Claims, der Cursor-Schwachstellenbericht und Exportkontroll-Gerüchte) sind nicht unabhängig bestätigt. Das Hugging-Face-Repository und die Hersteller-Docs nach Release erneut öffnen.

Offizielle / Repository-Quellen:

DeepSeek API Docs — DeepSeek-V4-Pro GA Release (Preisupdate)

Hugging Face — Qwen/Qwen3.8-2.4T-A95B

Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Z.ai Docs — GLM-5.3

Drittberichte:

21jingji — DeepSeek Peak-/Off-Peak-Sätze wirksam, Peak-Anstieg bis 1.100 %

VentureBeat — GLM-5.3 und die gemeldete Cursor-Schwachstelle

Sobald eine geteilte API auf Peak-Tal-Tarife umstellt, werden Cache-Hit-Rate und Egress-Isolation zu Rechnungsvariablen. Evals, Destillation und 24/7-Agents auf einer Session zu stapeln, macht Kosten und Exit-Policy schwerer steuerbar. Geteilte Cloud-Sessions bündeln Quoten, Logs und Guardrails in einer Schicht — Forensik und lokale Kontrolle leiden. Für Produktionsarbeit, die null Hypervisor-Verlust, stabiles iOS-CI/CD und dauerhafte AI-Agents braucht, ist ein VPSNIX-Cloud-Bare-Metal-Knoten in der Regel die bessere Wahl: 100 % Apple-Hardware, voller Root, keine Hypervisor-Steuer, Abrechnung nach Tag, Woche oder Monat, damit Off-Peak-Experimente vom Produktionspipeline getrennt bleiben. Siehe Mac-mini-M4-Miete im Kostenvergleich und die Preisseite.

SECTION 10 FAQ

Ist DeepSeek nach der Erhöhung noch günstiger als GPT-5.6 oder Claude?

Der Off-Peak-Satz bleibt günstiger als Claude Opus 5, ist aber nicht mehr die eindeutig günstigste Option insgesamt. OpenAIs GPT-5.6 Luna ($0,20 / $1,20 je Million Tokens) und Alibabas internationale Qwen3.8-Max-Preise ($2 / $6) unterbieten DeepSeeks neue Off-Peak-Sätze in mindestens einer Dimension. DeepSeek bleibt für ein Frontier-Modell vergleichsweise günstig, nur nicht mehr das eindeutig günstigste.

Darf ich Alibabas Qwen3.8-Max-Open-Weights kostenlos in einem kommerziellen Produkt nutzen?

Ja für die meisten Fälle — persönliche Projekte und interne Unternehmensnutzung bleiben unberührt. Die Ausnahme greift, wenn Sie ein Model-as-a-Service- oder AI-Work-Assistant-Geschäft betreiben, das in einem beliebigen zusammenhängenden 12-Monats-Zeitraum über 50 Mio. USD verdient hat; diese Stufe braucht eine separate kommerzielle Lizenz von Alibaba.

Ist Qwen3.8-Max für Nutzer in den USA, der EU oder dem Vereinigten Königreich gesperrt?

Nein. Diese Behauptung kursierte online, ist aber falsch — die veröffentlichte Lizenz enthält keinerlei geografische Beschränkung. Die Grenzen sind umsatzbasiert, nicht an Ihren Standort oder den Ihrer Nutzer gebunden.

Was unterscheidet GLM-5.3 tatsächlich von GLM-5.2?

Auf Basismodell-Ebene nichts — beide nutzen dasselbe 743-Milliarden-Parameter-Foundation-Modell. Die Leistungsgewinne (rund 6× auf Terminal-Bench 3.0) stammen vollständig aus der Skalierung von Reinforcement Learning im Post-Training, ohne Retraining der Basis.

Wird Meta wirklich das Flaggschiff öffnen — nicht nur das kleinere Muse Glimmer?

Noch nicht. Muse Glimmer ist ein 30B-destilliertes Modell, nicht Metas echtes Flaggschiff. Mark Zuckerberg hat Open Weights für das größere, geschlossene Muse Spark 1.2 für „bald“ angekündigt — wäre das der Fall, wäre es das erste US-Flaggschiff-Modell mit offener Freigabe. Zum Zeitpunkt dieses Textes ist diese Freigabe nicht erfolgt; als erklärte Absicht behandeln, nicht als bestätigten Fakt.