Главная / Блог / Биллинг API
ENGINEERING_BLOG · 2026.08.17

DeepSeek поднял пиковый cache-hit на 1 100% — сразу после open-weight блица китайских лабораторий

V4-PRO · PEAK CACHE-HIT INPUT
1 100%

С 00:00 по пекинскому времени 17 августа. Headline относится только к пиковому cache-hit input, не ко всему счёту.

Команды, которые платят за API DeepSeek, Qwen или GLM, за одну неделю получили три сигнала, которые не сходятся в историю про «дешёвый китайский токен». DeepSeek поднял отдельные строки тарифа до 1 100%. Alibaba в том же окне выложила в публичный репозиторий флагман на 2,4 трлн параметров, который раньше не отдавала весами. Zhipu выпустила GLM-5.3 и заявила примерно шестикратный рост coding-бенчмарка на той же базе — без retraining. Вывод: лаборатории больше не торгуют только ценой токена, они торгуют pricing power. Ниже — хронология, rate card, три механизма, сравнительная таблица, спорные утверждения и шестишаговый чеклист.

SECTION 01 Четыре ловушки до того, как умножать invoice на 1 100%

  • Headline — одна строка биллинга, не весь счёт: «11×», «более 1 100%» и «350%» одновременно верны. Они мапятся на пиковый cache-hit input, output и cache-miss input. Output (350%) и cache-miss двигают реальный invoice сильнее, чем почти нулевой cache-hit.
  • Пик считается по пекинскому времени: 9:00–12:00 и 14:00–18:00. Остальное — off-peak по половине пикового тарифа. Анонс явно просит сдвинуть нагрузку, а не «просто заплатить больше».
  • Open weights ≠ Apache 2.0: у Qwen3.8-Max своя лицензия. Model-as-a-Service или AI Work Assistant с выручкой свыше $50 млн за любое 12-месячное окно требует отдельной коммерческой сделки. Утверждения, что пользователи из США, ЕС, Великобритании или Кореи не могут скачать веса, ложны.
  • GLM-5.3 — не новая база: те же 743B параметров, что у GLM-5.2. Прирост — от масштабированного post-training RL. Цифры vendor-reported; независимого прогона пока нет. Контекст: DeepSeek V4 GA и пиково-долинный биллинг, бриф запуска Qwen3.8-Max.

SECTION 02 Хронология: что вышло и когда тариф реально сменился

Июль–август 2026: open-weight релизы и смена тарифов
Дата Событие
16 июля 2026 Moonshot AI выкладывает веса Kimi K3 (2,8T параметров), модель попадает под scrutiny США
30 июля 2026 OpenAI режет GPT-5.6 Luna на 80%
2–3 августа 2026 Alibaba сначала preview, затем запускает Qwen3.8-Max как hosted API
6–7 августа 2026 OpenAI делает Luna бесплатным default с unlimited text chats
10 августа 2026 Meta выпускает Muse Glimmer (30B, Apache 2.0) и тизерит open weights для флагмана Muse Spark 1.2
12 августа 2026 Alibaba публикует Qwen3.8-2.4T-A95B на Hugging Face / ModelScope; xAI выкатывает Grok 4.6
13 августа 2026 DeepSeek-V4-Pro выходит в GA и анонсирует повышение с 17 августа; Google отдаёт Gemini 3.7 Flash со скидкой
14 августа 2026 Zhipu выпускает GLM-5.3 на той же 743B-базе, что GLM-5.2
17 августа 2026, 00:00 Пекин Новый тариф DeepSeek вступает в силу

Если отойти от отдельных пресс-релизов: китайские лаборатории поднимают цены и открывают веса флагманов, американские — режут consumer-слой и уходят в free. Это две стороны одной борьбы за воронку. Срез OpenAI: заметка про снижение GPT-5.6 Luna / Terra / Sol.

SECTION 03 Цифры: строки DeepSeek, спека Qwen, GLM только post-training

Новые ставки DeepSeek действуют с 00:00 по пекинскому времени 17 августа. Пик — 9:00–12:00 и 14:00–18:00 по Пекину. Ниже — юани за 1M токенов, сверено с официальным анонсом и несколькими репортами.

Повышение DeepSeek по строкам (юани за 1M токенов)
Строка биллинга Старая цена Новый off-peak Новый пик Рост в пике
V4-Flash cache hit (input) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash cache miss (input) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash output ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro cache hit (input) ¥0.025 ¥0.15 ¥0.30 ~1 100%
V4-Pro cache miss (input) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro output ¥6.0 ¥13.5 ¥27.0 350%

1 100% относится к пиковому cache-hit input — строке, которая стартовала почти с нуля. Output, который доминирует в большинстве реальных счетов, вырос на 350%. Независимое моделирование тяжёлой off-peak нагрузки с половиной cache-hit даёт ближе к 1,8×.

Qwen3.8-2.4T-A95B (открытые веса Qwen3.8-Max)
Параметр Значение
Параметры 2,4T всего, 95B активных на токен (MoE, 512 экспертов, 10 routed + 1 shared)
Контекст 262 144 токена native (открытый checkpoint), расширяется до ~1,01M; hosted Max по умолчанию 1M
Каденция релиза Preview 2 августа → API live 3 августа → открытые веса 12 августа
API (international) $2/M input, $6/M output
Лицензия Не Apache 2.0 — отдельная Qwen3.8-Max License
Почему это важно Первый раз Alibaba открыла веса Max-флагмана; Qwen3.5 / 3.6 / 3.7 Max оставались только API
GLM-5.3 vs GLM-5.2: та же база, только post-training (самоотчёт Zhipu)
Бенчмарк GLM-5.2 GLM-5.3 Дельта
Terminal-Bench 3.0 4,6% 28,3% +23,7 п.п.
DeepSWE v1.1 46,2% 66,9% +20,7 п.п.
Agents' Last Exam (CLI) 23,8% 28,5% +4,7 п.п.
CyberGym 77,2% 84,5% +7,3 п.п.
AutomationBench 26,2% 48,2% +22,0 п.п.

Это цифры самой Zhipu. Независимого third-party прогона нет. На Terminal-Bench 3.0 GLM-5.3 всё ещё позади GPT-5.6 Sol (34,6%) и Claude Fable 5 (33,7%). Это сильный open-weight результат, не outright frontier win.

SECTION 04 Три механизма: time-of-day тариф, кастомная лицензия, масштаб post-training

DeepSeek: это дефицит compute, не смена стратегии

Лёгкое прочтение — «самая дешёвая китайская модель сдалась марже». Структура rate card говорит об обратном: constraint по GPU вынесли на прайс-лист. Плоский дешёвый тариф работал как acquisition, пока supply держал экспоненциальный usage. Когда usage вырос, а ёмкость нет, что-то должно было стать явным. Формула «поощряем более гибкое планирование нагрузки» на инженерном языке значит: пиковый compute стал scarce — сдвиньте нагрузку сами.

Деталь, которую международные обзоры почти не заметили: в пике официальный API DeepSeek теперь дороже ряда сторонних реселлеров (GMI Cloud, Novita и другие всё ещё держат V4 Pro ниже нового официального пика). Допущение «официальный endpoint всегда самый дешёвый способ гонять DeepSeek» сломалось впервые.

Alibaba: веса покупают mindshare, лицензия держит потолок выручки

Alibaba сделала две вещи сразу. Полный 2,4T checkpoint лежит в публичном репозитории бесплатно. На него повешена кастомная лицензия — не Apache 2.0, как у меньших Qwen, — которая требует отдельной коммерческой сделки для Model-as-a-Service или AI Work Assistant с выручкой свыше $50 млн за любое 12-месячное окно и обязывает продукты с 100M+ MAU или $20M+ месячной выручки явно указывать имя модели.

Отдать веса, чтобы забрать разработчиков, особенно за пределами Китая. Оставить рычаг над теми, кто способен построить конкурирующий inference-бизнес поверх checkpoint. Это другая ставка, чем Muse Glimmer у Meta под неограниченным Apache 2.0. Тезис, что лицензия запрещает скачивание из США, ЕС, Великобритании и Южной Кореи, ложен: в опубликованном тексте нет географической оговорки.

GLM-5.3: новая база не нужна — метод и есть история

Та же 743B-база, что у GLM-5.2. Без retraining. Примерно 6× на Terminal-Bench 3.0 (4,6% → 28,3%) за счёт масштабирования RL-окружений в post-training. Когда pretrain scaling даёт убывающую отдачу, post-training RL становится отдельным рычагом с гораздо более низким cost floor, чем переобучение foundation. Mid-tier лаборатории без compute масштаба OpenAI всё ещё могут закрывать разрыв на agentic и coding-бенчмарках.

deepseek-v4-pro-cny-per-1m.txt
V4-Pro  per 1M tokens  CNY  (Beijing peak 09-12 / 14-18)
off-peak  cache-hit 0.15   miss 4.5   out 13.5
peak      cache-hit 0.30   miss 9.0   out 27.0
headline  ~1100% = peak cache-hit input only

SECTION 05 Сравнение: DeepSeek всё ещё самый дешёвый frontier-класс?

Input / output за 1M токенов
Модель Input Output Открытые веса?
DeepSeek V4-Pro (пик) ¥9.0 (~$1.26) ¥27.0 (~$3.78) Нет
DeepSeek V4-Pro (off-peak) ¥4.5 (~$0.63) ¥13.5 (~$1.89) Нет
Qwen3.8-Max (international API) $2.00 $6.00 Да (кастомная лицензия)
OpenAI GPT-5.6 Luna $0.20 $1.20 Нет
Claude Opus 5 (implied, по соотношению Alibaba) ~$5.00 ~$25.00 Нет

Курс примерно ¥7.15/$1, оценка. Off-peak V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не абсолютный минимум. International тариф Qwen3.8-Max и Luna у OpenAI оба подрезают новый off-peak DeepSeek хотя бы по одной оси. Формула «китайская модель = самая дешёвая» держалась большую часть 2025 и начала 2026. Как рабочая гипотеза она больше не безопасна.

SECTION 06 Что оспаривается или ещё не верифицировано

  • Headline 1 100% точен и вводит в заблуждение без контекста. Он относится только к пиковому cache-hit input. Output — строка, которая доминирует в большинстве реальных счетов, — вырос на 350%.
  • Утверждения, что Qwen3.8-Max крутится на собственных чипах Alibaba Zhenwu M890 (и супернодах «Pangu AL128»), которые разошлись в нескольких китайских финансовых изданиях, Alibaba не подтвердила ни технической документацией, ни независимыми бенчмарками. Это vendor-adjacent репорт, не verified fact.
  • Сообщение, что GLM-5.3 нашла «серьёзную уязвимость» в Cursor, идёт от VentureBeat и собственного disclosure Zhipu. Технических деталей в открытом доступе нет. Читать как vendor-sourced, не как независимый аудит.
  • Репорты, что Министерство коммерции КНР готовит ответные экспортные ограничения на AI / полупроводниковые технологии, спекулятивны и опираются на неподтверждённые медиа, не на официальный анонс.

SECTION 07 Зачем это важно: две ценовые войны идут параллельно

За последний месяц топ-лаборатории Китая выкатывали релизы в темпе, который внутренняя финансовая пресса называет «три обновления модели в неделю». DeepSeek, Alibaba и Zhipu стоят поверх Kimi K3 от Moonshot (веса 16 июля, 2,8T) и MiniMax H3. Китайские обзоры читают это как open-weight давление, которое принудительно переоценивает отрасль, — жёстче, чем большинство англоязычных product write-up. Фон по Kimi K3: полный open-weight релиз Kimi K3.

Американские лаборатории на consumer-слое играют наоборот. OpenAI 30 июля режет самый дешёвый тир на 80%, через неделю делает эту модель бесплатной и unlimited. Google 13 августа отдаёт coding-модель вдвое дешевле трёхнедельного предшественника. Китайские лаборатории открывают веса флагманов и вводят ступенчатый, более высокий тариф на compute-constrained вершине. Американские бегут к free и cheap на consumer-конце. Оба хода реальны. Они оптимизируют разные участки воронки.

Есть и геополитический слой, который стоит назвать аккуратно. Kimi K3 уже попал под scrutiny США. Часть аналитиков читает выбор Alibaba открыть 2,4T-флагман именно в этом окне как попытку зафиксировать международный mindshare и нарратив «технологического паритета» до возможного регуляторного сжатия. Это informed interpretation, не подтверждённый факт — и его легко пропустить, если читать только англоязычный tech press, где каждый релиз выглядит изолированным product news.

SECTION 08 Шестишаговый чеклист: как читать повышение против собственного счёта

  1. Разделение headline-процента и строк invoice. Cache-hit input, cache-miss input и output — разные линии. Нельзя натягивать 1 100% на весь месяц.
  2. Привязка нагрузки к пиковым окнам по пекинскому времени. 9:00–12:00 и 14:00–18:00 по Пекину идут по пику. Batch evals, офлайн-дистилляция и ночной replay агентов относятся к off-peak.
  3. Оценка счёта по реальному cache-hit rate. Тяжёлые пользователи с высоким попаданием в кэш и преимущественно off-peak трафиком моделировались около 1,8×. Пик плюс низкий hit rate — это то, что приближается к headline.
  4. Чтение файла лицензии Qwen3.8-Max, а не треда анонса. Личное и внутреннее использование в основном не затронуто. MaaS / AI Work Assistant с выручкой свыше $50 млн за любое 12-месячное окно требует отдельной коммерческой лицензии. 100M+ MAU или $20M+ месячной выручки — явное указание имени модели. Географического запрета нет.
  5. Отделение vendor-бенчмарков GLM-5.3 от независимых прогонов. 4,6% → 28,3% на Terminal-Bench 3.0 — самоотчёт. Не писать «frontier win», пока нет независимого прогона.
  6. Вынесение неподтверждённых утверждений в отдельный ledger. Zhenwu M890 / Pangu AL128, уязвимость Cursor и слухи про экспортный контроль — не подтверждённые факты. Чувствительные evals и off-peak эксперименты, которым нужен контролируемый egress и Root, относятся на изолированную физическую ноду, не на shared cloud session.

SECTION 09 Цитируемые цифры и первичные источники

  • V4-Pro пиковый cache-hit input: ¥0.025 → ¥0.30, ~1 100%; output ¥6.0 → ¥27.0, 350%
  • Qwen3.8-2.4T-A95B: 2,4T всего / 95B active; 262K native, ~1,01M расширяемый; international API $2 / $6
  • GLM-5.3 Terminal-Bench 3.0: 4,6% → 28,3% (+23,7), та же 743B-база, без retraining; vendor-reported
  • Пороги лицензии: $50M / 12 месяцев MaaS или AI Work Assistant — отдельная лицензия; 100M MAU или $20M месячной выручки — явное имя модели

Официальные и сторонние ссылки ниже. Перед перепубликацией сверить актуальный официальный тариф и текст лицензии. Детали, помеченные выше как неверифицированные (отечественные чипы, репорт про уязвимость Cursor, слухи про экспортный контроль), независимо не подтверждены.

Официальные источники и репозитории:

DeepSeek API Docs — DeepSeek-V4-Pro GA Release (обновление тарифа)

Hugging Face — Qwen/Qwen3.8-2.4T-A95B

Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Z.ai Docs — GLM-5.3

Сторонние репорты:

21jingji — пиковые и off-peak ставки DeepSeek вступили в силу, рост в пике до 1 100%

VentureBeat — GLM-5.3 и репорт про уязвимость Cursor

Когда shared API уходит в time-of-day тариф, cache-hit rate и изоляция egress становятся переменными счёта. Сваливать evals, дистилляцию и круглосуточных агентов в одну shared-сессию делает и стоимость, и политику выхода хуже контролируемыми. Виртуализация режет нативную производительность, совместимость с Apple toolchain плавает, долгосрочная стабильность shared-сессий слабее изолированной ноды. Для продакшена, которому нужен нулевой hypervisor tax, стабильный iOS CI/CD и агенты 7×24, облачная физическая нода VPSNIX обычно лучший fit — оригинальное железо Apple, полный Root, без Hypervisor, оплата день / неделя / месяц, чтобы отделить off-peak эксперименты от production pipeline. См. разбор аренды Mac mini M4 и страницу тарифов.

SECTION 10 Часто задаваемые вопросы

DeepSeek после повышения всё ещё дешевле GPT-5.6 и Claude?

Off-peak ставка всё ещё ниже Claude Opus 5, но это уже не абсолютный минимум по рынку. GPT-5.6 Luna у OpenAI ($0.20 / $1.20 за миллион токенов) и international тариф Qwen3.8-Max ($2 / $6) подрезают новый off-peak DeepSeek хотя бы по одной оси. Для frontier-класса DeepSeek всё ещё относительно дёшев, просто больше не самый дешёвый без оговорок.

Можно ли бесплатно использовать открытые веса Qwen3.8-Max в коммерческом продукте?

Для большинства сценариев да — личные проекты и внутреннее корпоративное использование не затронуты. Ограничение срабатывает, если вы ведёте Model-as-a-Service или AI Work Assistant с выручкой свыше $50 млн за любое последовательное 12-месячное окно: этому тиру нужна отдельная коммерческая лицензия Alibaba.

Qwen3.8-Max запрещён или ограничен для пользователей США, ЕС или Великобритании?

Нет. Этот тезис разошёлся в сети, но он ложен: в опубликованной лицензии нет географического ограничения любого вида. Ограничения завязаны на выручку, не на то, где находитесь вы или ваши пользователи.

Чем GLM-5.3 реально отличается от GLM-5.2?

На уровне базы — ничем: обе сидят на одной foundation-модели на 743 млрд параметров. Прирост (примерно 6× на Terminal-Bench 3.0) целиком из масштабирования reinforcement learning в post-training, без retraining базы.

Meta действительно откроет флагман, а не только меньший Muse Glimmer?

Пока нет. Muse Glimmer — дистиллированная 30B, не настоящий флагман. Марк Цукерберг говорил, что открытые веса более крупной закрытой Muse Spark 1.2 будут «скоро»; если это случится, это будет первый открытый US-флагман такого класса. На момент текста релиза нет; это заявленное намерение, не подтверждённый факт.