Команды, которые платят за API DeepSeek, Qwen или GLM, за одну неделю получили три сигнала, которые не сходятся в историю про «дешёвый китайский токен». DeepSeek поднял отдельные строки тарифа до 1 100%. Alibaba в том же окне выложила в публичный репозиторий флагман на 2,4 трлн параметров, который раньше не отдавала весами. Zhipu выпустила GLM-5.3 и заявила примерно шестикратный рост coding-бенчмарка на той же базе — без retraining. Вывод: лаборатории больше не торгуют только ценой токена, они торгуют pricing power. Ниже — хронология, rate card, три механизма, сравнительная таблица, спорные утверждения и шестишаговый чеклист.
SECTION 01 Четыре ловушки до того, как умножать invoice на 1 100%
- Headline — одна строка биллинга, не весь счёт: «11×», «более 1 100%» и «350%» одновременно верны. Они мапятся на пиковый cache-hit input, output и cache-miss input. Output (350%) и cache-miss двигают реальный invoice сильнее, чем почти нулевой cache-hit.
- Пик считается по пекинскому времени: 9:00–12:00 и 14:00–18:00. Остальное — off-peak по половине пикового тарифа. Анонс явно просит сдвинуть нагрузку, а не «просто заплатить больше».
- Open weights ≠ Apache 2.0: у Qwen3.8-Max своя лицензия. Model-as-a-Service или AI Work Assistant с выручкой свыше $50 млн за любое 12-месячное окно требует отдельной коммерческой сделки. Утверждения, что пользователи из США, ЕС, Великобритании или Кореи не могут скачать веса, ложны.
- GLM-5.3 — не новая база: те же 743B параметров, что у GLM-5.2. Прирост — от масштабированного post-training RL. Цифры vendor-reported; независимого прогона пока нет. Контекст: DeepSeek V4 GA и пиково-долинный биллинг, бриф запуска Qwen3.8-Max.
SECTION 02 Хронология: что вышло и когда тариф реально сменился
| Дата | Событие |
|---|---|
| 16 июля 2026 | Moonshot AI выкладывает веса Kimi K3 (2,8T параметров), модель попадает под scrutiny США |
| 30 июля 2026 | OpenAI режет GPT-5.6 Luna на 80% |
| 2–3 августа 2026 | Alibaba сначала preview, затем запускает Qwen3.8-Max как hosted API |
| 6–7 августа 2026 | OpenAI делает Luna бесплатным default с unlimited text chats |
| 10 августа 2026 | Meta выпускает Muse Glimmer (30B, Apache 2.0) и тизерит open weights для флагмана Muse Spark 1.2 |
| 12 августа 2026 | Alibaba публикует Qwen3.8-2.4T-A95B на Hugging Face / ModelScope; xAI выкатывает Grok 4.6 |
| 13 августа 2026 | DeepSeek-V4-Pro выходит в GA и анонсирует повышение с 17 августа; Google отдаёт Gemini 3.7 Flash со скидкой |
| 14 августа 2026 | Zhipu выпускает GLM-5.3 на той же 743B-базе, что GLM-5.2 |
| 17 августа 2026, 00:00 Пекин | Новый тариф DeepSeek вступает в силу |
Если отойти от отдельных пресс-релизов: китайские лаборатории поднимают цены и открывают веса флагманов, американские — режут consumer-слой и уходят в free. Это две стороны одной борьбы за воронку. Срез OpenAI: заметка про снижение GPT-5.6 Luna / Terra / Sol.
SECTION 03 Цифры: строки DeepSeek, спека Qwen, GLM только post-training
Новые ставки DeepSeek действуют с 00:00 по пекинскому времени 17 августа. Пик — 9:00–12:00 и 14:00–18:00 по Пекину. Ниже — юани за 1M токенов, сверено с официальным анонсом и несколькими репортами.
| Строка биллинга | Старая цена | Новый off-peak | Новый пик | Рост в пике |
|---|---|---|---|---|
| V4-Flash cache hit (input) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash cache miss (input) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash output | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro cache hit (input) | ¥0.025 | ¥0.15 | ¥0.30 | ~1 100% |
| V4-Pro cache miss (input) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro output | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
1 100% относится к пиковому cache-hit input — строке, которая стартовала почти с нуля. Output, который доминирует в большинстве реальных счетов, вырос на 350%. Независимое моделирование тяжёлой off-peak нагрузки с половиной cache-hit даёт ближе к 1,8×.
| Параметр | Значение |
|---|---|
| Параметры | 2,4T всего, 95B активных на токен (MoE, 512 экспертов, 10 routed + 1 shared) |
| Контекст | 262 144 токена native (открытый checkpoint), расширяется до ~1,01M; hosted Max по умолчанию 1M |
| Каденция релиза | Preview 2 августа → API live 3 августа → открытые веса 12 августа |
| API (international) | $2/M input, $6/M output |
| Лицензия | Не Apache 2.0 — отдельная Qwen3.8-Max License |
| Почему это важно | Первый раз Alibaba открыла веса Max-флагмана; Qwen3.5 / 3.6 / 3.7 Max оставались только API |
| Бенчмарк | GLM-5.2 | GLM-5.3 | Дельта |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6% | 28,3% | +23,7 п.п. |
| DeepSWE v1.1 | 46,2% | 66,9% | +20,7 п.п. |
| Agents' Last Exam (CLI) | 23,8% | 28,5% | +4,7 п.п. |
| CyberGym | 77,2% | 84,5% | +7,3 п.п. |
| AutomationBench | 26,2% | 48,2% | +22,0 п.п. |
Это цифры самой Zhipu. Независимого third-party прогона нет. На Terminal-Bench 3.0 GLM-5.3 всё ещё позади GPT-5.6 Sol (34,6%) и Claude Fable 5 (33,7%). Это сильный open-weight результат, не outright frontier win.
SECTION 04 Три механизма: time-of-day тариф, кастомная лицензия, масштаб post-training
DeepSeek: это дефицит compute, не смена стратегии
Лёгкое прочтение — «самая дешёвая китайская модель сдалась марже». Структура rate card говорит об обратном: constraint по GPU вынесли на прайс-лист. Плоский дешёвый тариф работал как acquisition, пока supply держал экспоненциальный usage. Когда usage вырос, а ёмкость нет, что-то должно было стать явным. Формула «поощряем более гибкое планирование нагрузки» на инженерном языке значит: пиковый compute стал scarce — сдвиньте нагрузку сами.
Деталь, которую международные обзоры почти не заметили: в пике официальный API DeepSeek теперь дороже ряда сторонних реселлеров (GMI Cloud, Novita и другие всё ещё держат V4 Pro ниже нового официального пика). Допущение «официальный endpoint всегда самый дешёвый способ гонять DeepSeek» сломалось впервые.
Alibaba: веса покупают mindshare, лицензия держит потолок выручки
Alibaba сделала две вещи сразу. Полный 2,4T checkpoint лежит в публичном репозитории бесплатно. На него повешена кастомная лицензия — не Apache 2.0, как у меньших Qwen, — которая требует отдельной коммерческой сделки для Model-as-a-Service или AI Work Assistant с выручкой свыше $50 млн за любое 12-месячное окно и обязывает продукты с 100M+ MAU или $20M+ месячной выручки явно указывать имя модели.
Отдать веса, чтобы забрать разработчиков, особенно за пределами Китая. Оставить рычаг над теми, кто способен построить конкурирующий inference-бизнес поверх checkpoint. Это другая ставка, чем Muse Glimmer у Meta под неограниченным Apache 2.0. Тезис, что лицензия запрещает скачивание из США, ЕС, Великобритании и Южной Кореи, ложен: в опубликованном тексте нет географической оговорки.
GLM-5.3: новая база не нужна — метод и есть история
Та же 743B-база, что у GLM-5.2. Без retraining. Примерно 6× на Terminal-Bench 3.0 (4,6% → 28,3%) за счёт масштабирования RL-окружений в post-training. Когда pretrain scaling даёт убывающую отдачу, post-training RL становится отдельным рычагом с гораздо более низким cost floor, чем переобучение foundation. Mid-tier лаборатории без compute масштаба OpenAI всё ещё могут закрывать разрыв на agentic и coding-бенчмарках.
V4-Pro per 1M tokens CNY (Beijing peak 09-12 / 14-18)
off-peak cache-hit 0.15 miss 4.5 out 13.5
peak cache-hit 0.30 miss 9.0 out 27.0
headline ~1100% = peak cache-hit input only
SECTION 05 Сравнение: DeepSeek всё ещё самый дешёвый frontier-класс?
| Модель | Input | Output | Открытые веса? |
|---|---|---|---|
| DeepSeek V4-Pro (пик) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Нет |
| DeepSeek V4-Pro (off-peak) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Нет |
| Qwen3.8-Max (international API) | $2.00 | $6.00 | Да (кастомная лицензия) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Нет |
| Claude Opus 5 (implied, по соотношению Alibaba) | ~$5.00 | ~$25.00 | Нет |
Курс примерно ¥7.15/$1, оценка. Off-peak V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не абсолютный минимум. International тариф Qwen3.8-Max и Luna у OpenAI оба подрезают новый off-peak DeepSeek хотя бы по одной оси. Формула «китайская модель = самая дешёвая» держалась большую часть 2025 и начала 2026. Как рабочая гипотеза она больше не безопасна.
SECTION 06 Что оспаривается или ещё не верифицировано
- Headline 1 100% точен и вводит в заблуждение без контекста. Он относится только к пиковому cache-hit input. Output — строка, которая доминирует в большинстве реальных счетов, — вырос на 350%.
- Утверждения, что Qwen3.8-Max крутится на собственных чипах Alibaba Zhenwu M890 (и супернодах «Pangu AL128»), которые разошлись в нескольких китайских финансовых изданиях, Alibaba не подтвердила ни технической документацией, ни независимыми бенчмарками. Это vendor-adjacent репорт, не verified fact.
- Сообщение, что GLM-5.3 нашла «серьёзную уязвимость» в Cursor, идёт от VentureBeat и собственного disclosure Zhipu. Технических деталей в открытом доступе нет. Читать как vendor-sourced, не как независимый аудит.
- Репорты, что Министерство коммерции КНР готовит ответные экспортные ограничения на AI / полупроводниковые технологии, спекулятивны и опираются на неподтверждённые медиа, не на официальный анонс.
SECTION 07 Зачем это важно: две ценовые войны идут параллельно
За последний месяц топ-лаборатории Китая выкатывали релизы в темпе, который внутренняя финансовая пресса называет «три обновления модели в неделю». DeepSeek, Alibaba и Zhipu стоят поверх Kimi K3 от Moonshot (веса 16 июля, 2,8T) и MiniMax H3. Китайские обзоры читают это как open-weight давление, которое принудительно переоценивает отрасль, — жёстче, чем большинство англоязычных product write-up. Фон по Kimi K3: полный open-weight релиз Kimi K3.
Американские лаборатории на consumer-слое играют наоборот. OpenAI 30 июля режет самый дешёвый тир на 80%, через неделю делает эту модель бесплатной и unlimited. Google 13 августа отдаёт coding-модель вдвое дешевле трёхнедельного предшественника. Китайские лаборатории открывают веса флагманов и вводят ступенчатый, более высокий тариф на compute-constrained вершине. Американские бегут к free и cheap на consumer-конце. Оба хода реальны. Они оптимизируют разные участки воронки.
Есть и геополитический слой, который стоит назвать аккуратно. Kimi K3 уже попал под scrutiny США. Часть аналитиков читает выбор Alibaba открыть 2,4T-флагман именно в этом окне как попытку зафиксировать международный mindshare и нарратив «технологического паритета» до возможного регуляторного сжатия. Это informed interpretation, не подтверждённый факт — и его легко пропустить, если читать только англоязычный tech press, где каждый релиз выглядит изолированным product news.
SECTION 08 Шестишаговый чеклист: как читать повышение против собственного счёта
- Разделение headline-процента и строк invoice. Cache-hit input, cache-miss input и output — разные линии. Нельзя натягивать 1 100% на весь месяц.
- Привязка нагрузки к пиковым окнам по пекинскому времени. 9:00–12:00 и 14:00–18:00 по Пекину идут по пику. Batch evals, офлайн-дистилляция и ночной replay агентов относятся к off-peak.
- Оценка счёта по реальному cache-hit rate. Тяжёлые пользователи с высоким попаданием в кэш и преимущественно off-peak трафиком моделировались около 1,8×. Пик плюс низкий hit rate — это то, что приближается к headline.
- Чтение файла лицензии Qwen3.8-Max, а не треда анонса. Личное и внутреннее использование в основном не затронуто. MaaS / AI Work Assistant с выручкой свыше $50 млн за любое 12-месячное окно требует отдельной коммерческой лицензии. 100M+ MAU или $20M+ месячной выручки — явное указание имени модели. Географического запрета нет.
- Отделение vendor-бенчмарков GLM-5.3 от независимых прогонов. 4,6% → 28,3% на Terminal-Bench 3.0 — самоотчёт. Не писать «frontier win», пока нет независимого прогона.
- Вынесение неподтверждённых утверждений в отдельный ledger. Zhenwu M890 / Pangu AL128, уязвимость Cursor и слухи про экспортный контроль — не подтверждённые факты. Чувствительные evals и off-peak эксперименты, которым нужен контролируемый egress и Root, относятся на изолированную физическую ноду, не на shared cloud session.
SECTION 09 Цитируемые цифры и первичные источники
- V4-Pro пиковый cache-hit input: ¥0.025 → ¥0.30, ~1 100%; output ¥6.0 → ¥27.0, 350%
- Qwen3.8-2.4T-A95B: 2,4T всего / 95B active; 262K native, ~1,01M расширяемый; international API $2 / $6
- GLM-5.3 Terminal-Bench 3.0: 4,6% → 28,3% (+23,7), та же 743B-база, без retraining; vendor-reported
- Пороги лицензии: $50M / 12 месяцев MaaS или AI Work Assistant — отдельная лицензия; 100M MAU или $20M месячной выручки — явное имя модели
Официальные и сторонние ссылки ниже. Перед перепубликацией сверить актуальный официальный тариф и текст лицензии. Детали, помеченные выше как неверифицированные (отечественные чипы, репорт про уязвимость Cursor, слухи про экспортный контроль), независимо не подтверждены.
Официальные источники и репозитории:
DeepSeek API Docs — DeepSeek-V4-Pro GA Release (обновление тарифа)
Hugging Face — Qwen/Qwen3.8-2.4T-A95B
Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities
Сторонние репорты:
21jingji — пиковые и off-peak ставки DeepSeek вступили в силу, рост в пике до 1 100%
VentureBeat — GLM-5.3 и репорт про уязвимость Cursor
Когда shared API уходит в time-of-day тариф, cache-hit rate и изоляция egress становятся переменными счёта. Сваливать evals, дистилляцию и круглосуточных агентов в одну shared-сессию делает и стоимость, и политику выхода хуже контролируемыми. Виртуализация режет нативную производительность, совместимость с Apple toolchain плавает, долгосрочная стабильность shared-сессий слабее изолированной ноды. Для продакшена, которому нужен нулевой hypervisor tax, стабильный iOS CI/CD и агенты 7×24, облачная физическая нода VPSNIX обычно лучший fit — оригинальное железо Apple, полный Root, без Hypervisor, оплата день / неделя / месяц, чтобы отделить off-peak эксперименты от production pipeline. См. разбор аренды Mac mini M4 и страницу тарифов.
SECTION 10 Часто задаваемые вопросы
DeepSeek после повышения всё ещё дешевле GPT-5.6 и Claude?
Off-peak ставка всё ещё ниже Claude Opus 5, но это уже не абсолютный минимум по рынку. GPT-5.6 Luna у OpenAI ($0.20 / $1.20 за миллион токенов) и international тариф Qwen3.8-Max ($2 / $6) подрезают новый off-peak DeepSeek хотя бы по одной оси. Для frontier-класса DeepSeek всё ещё относительно дёшев, просто больше не самый дешёвый без оговорок.
Можно ли бесплатно использовать открытые веса Qwen3.8-Max в коммерческом продукте?
Для большинства сценариев да — личные проекты и внутреннее корпоративное использование не затронуты. Ограничение срабатывает, если вы ведёте Model-as-a-Service или AI Work Assistant с выручкой свыше $50 млн за любое последовательное 12-месячное окно: этому тиру нужна отдельная коммерческая лицензия Alibaba.
Qwen3.8-Max запрещён или ограничен для пользователей США, ЕС или Великобритании?
Нет. Этот тезис разошёлся в сети, но он ложен: в опубликованной лицензии нет географического ограничения любого вида. Ограничения завязаны на выручку, не на то, где находитесь вы или ваши пользователи.
Чем GLM-5.3 реально отличается от GLM-5.2?
На уровне базы — ничем: обе сидят на одной foundation-модели на 743 млрд параметров. Прирост (примерно 6× на Terminal-Bench 3.0) целиком из масштабирования reinforcement learning в post-training, без retraining базы.
Meta действительно откроет флагман, а не только меньший Muse Glimmer?
Пока нет. Muse Glimmer — дистиллированная 30B, не настоящий флагман. Марк Цукерберг говорил, что открытые веса более крупной закрытой Muse Spark 1.2 будут «скоро»; если это случится, это будет первый открытый US-флагман такого класса. На момент текста релиза нет; это заявленное намерение, не подтверждённый факт.