Главная / Блог / DeepSeek V4
ENGINEERING_BLOG · 2026.07.20

DeepSeek V4 GA: тарифы, архитектура и разрыв с GPT-5.6

DEEPSEEK V4-PRO · SWE-bench Verified
80.6%

Open-source рекорд, паритет с Gemini 3.1 Pro; output от $0,87/M (off-peak).

Если вы выбираете open-source LLM в 2026 для code agents или всё ещё держите production на deepseek-chat, DeepSeek V4 GA (релиз 20 июля 2026) меняет правила. Материал для AI-разработчиков и техлидов: низкоуровневая архитектура CSA/HCA/mHC/Muon, бенчмарки против GPT-5.6 и Claude Fable 5, peak/off-peak billing и миграция API до 24 июля. Вывод заранее: V4 пока не обгоняет closed-source флагманы, но даёт лучшую open-source производительность за 1/10–1/100 стоимости; peak-тарифы удваивают счёт, но $0,87/M output остаётся конкурентным.

SECTION 01 Три риска при запуске DeepSeek V4 GA

  • Legacy endpoints отключаются: deepseek-chat и deepseek-reasoner перестанут работать 24 июля 2026, 23:59 (Пекин) — немигрированный production упадёт мгновенно.
  • Первый peak/off-peak billing: будни 09:00–12:00 и 14:00–18:00 (Пекин) — тариф ×2; 24/7 pipeline без scheduling раздует invoice.
  • Cloud API не заменяет build chain: даже V4-Pro не собирает стабильно на виртуализированном macOS; см. сравнение аренды и покупки Mac mini M4.
  • Preview vs GA: архитектура та же, но GA усилил agent, math и code generation — оценивайте по новым тарифам, а не по апрельской preview.

SECTION 02 Timeline: от preview к GA 20 июля 2026

DeepSeek V4 — ключевые даты
Дата Событие
2026-04-24 V4 preview + open source (MIT): V4-Pro (1,6T) и V4-Flash (284B)
2026-05 Production tuning Flash и Pro, API в general availability
2026-06 V4-Pro output −75 % навсегда до $0,87/M tokens
2026-06-29 Email всем API-пользователям: GA в середине июля, первое раскрытие peak/off-peak
2026-07-19 Gray access GA для избранных разработчиков, пресса о «полной версии завтра»
2026-07-20 GA официально live
2026-07-24 deepseek-chat и deepseek-reasoner offline навсегда

Кратко: preview уже был сильным; GA доработал agent capabilities, math reasoning и code gen и ввёл дисциплинированную коммерциализацию — от «почти бесплатно» к предсказуемому billing.

SECTION 03 V4-Pro и V4-Flash: CSA, HCA, mHC, Muon и три режима inference

Семейство DeepSeek V4 — спецификации
Параметр V4-Pro V4-Flash
Всего параметров 1,6 трлн (1,6T) 284 млрд (284B)
Активных параметров/token 49 млрд (49B) 13 млрд (13B)
Слоёв Transformer 61 43
Контекстное окно 1 000 000 tokens 1 000 000 tokens
Max output 384K tokens 384K tokens
Точность FP4 (experts) + FP8 (остальное) FP4 + FP8 mixed
Pretraining 33T+ tokens 32T+ tokens
Лицензия MIT MIT

V4 отказался от MLA (V2/V3) в пользу гибрида Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA). CSA: Softmax-gated pooling сжимает KV-последовательность ×4, FP4 «lightning indexer» делает top-k sparsity (Pro: top-1024, Flash: top-512), плюс sliding window 128 tokens. HCA: ×128 compression для global dense attention. На 1M контекста — 27 % inference FLOPs vs V3.2, KV-cache memory 10 % (Flash: 7 %).

Manifold-Constrained Hyper-Connections (mHC) стабилизируют 61-слойную сеть через 4-channel residual flow и doubly-stochastic matrix constraints. Training на Muon optimizer (Newton-Schulz orthogonalization gradients) вместо AdamW — быстрее и стабильнее сходимость на deep stack.

Три режима inference
Режим Механика Use case
Non-think Без chain-of-thought, минимальная latency Простые Q&A, routing
Think High Explicit reasoning (thinking tags) Средняя сложность, code debug
Think Max Max reasoning depth, контекст 384K+ Math, long-chain agents

Рекомендуемые sampling params: temperature=1.0, top_p=1.0 (все режимы).

SECTION 04 Benchmarks: SWE-bench 80,6 % и cost gap 116×

V4-Pro — ключевые бенчмарки
Бенчмарк DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % 96,0 % не опубликован отдельно ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3 206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

SWE-bench Verified — реальные GitHub bugfix tasks; 80,6 % — open-source record, паритет с Gemini 3.1 Pro. По Artificial Analysis, Claude Fable 5 в Strategy & Ops index стоит $3,48 за run (50 points), V4-Pro — $0,03 (38 points). Fable 5 дороже в 116×, score выше лишь на ~12 points (~31 %).

SECTION 05 GPT-5.6 / Claude Fable 5 и таблица peak/off-peak

Три frontier-модели
Измерение DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open source / self-host MIT Нет Нет
Контекст 1M tokens не раскрыт 1M tokens
API output (off-peak) $0,87/M ~$15/M $50/M
API output (peak) $1,74/M
Code capability Очень сильный (близко к Fable 5) Очень сильный Лидер
Data privacy Private deployment Cloud only Cloud only

Матрица сценариев: budget / high frequency / self-host → V4-Pro или Flash; max code quality → Claude Fable 5; hard math → GPT-5.6 Sol/Ultra; massive logs → V4-Flash (cache hit input $0,0028/M). Контекст open-source landscape: обзор Kimi K3 (2,8T).

Peak/off-peak pricing (peak: будни 09:00–12:00, 14:00–18:00 Пекин, ×2)
Модель Позиция Off-peak Peak
V4-Pro Input (cache hit) ¥0,025 / $0,0035 / 1M ×2
V4-Pro Input (cache miss) ¥3,00 / $0,435 / 1M ¥6,00 / $0,87 / 1M
V4-Pro Output ¥6,00 / $0,87 / 1M ¥12,00 / $1,74 / 1M
V4-Flash Input (cache hit) ¥0,02 / $0,0028 / 1M ×2
V4-Flash Input (cache miss) ¥1,00 / $0,14 / 1M ¥2,00 / $0,28 / 1M
V4-Flash Output ¥2,00 / $0,28 / 1M ¥4,00 / $0,56 / 1M

Оптимизация: batch jobs после 18:00 или до 09:00; Prompt Cache для hit rate; простой routing на Flash, heavy reasoning на Pro. Даже в peak V4-Pro output $1,74/M — в 8,6× дешевле Claude Opus 4.8 ($15/M).

SECTION 06 Миграция API до 24 июля: шесть шагов и Python

Deadline: deepseek-chat и deepseek-reasoner offline 24 июля 2026, 15:59 UTC (23:59 Пекин).

Mapping миграции
Старая модель Новая модель Примечание
deepseek-chat deepseek-v4-flash (Non-think) Быстро, лёгкие задачи
deepseek-reasoner deepseek-v4-flash (Think mode) или upgrade на deepseek-v4-pro
  1. Grep по codebase: repos, CI, env vars на deepseek-chat / deepseek-reasoner.
  2. Выбор target model: лёгкий dialog → deepseek-v4-flash; complex reasoning → deepseek-v4-pro.
  3. Обновить OpenAI SDK: менять только model, base_url=https://api.deepseek.com без изменений.
  4. Thinking mode (optional): через extra_body — замена deepseek-reasoner.
  5. Staging load test: latency, token billing, peak/off-peak invoice.
  6. Canary rollout до 24.07: switch production, monitor error rate; DeepSeek шлёт email за 24 ч до pricing changes.
deepseek_v4_migration.py
from openai import OpenAI

client = OpenAI(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Проанализируй этот Swift-код на узкие места производительности..."}],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 поддерживает OpenAI ChatCompletions и Anthropic Messages; в Anthropic SDK base_url тот же, modeldeepseek-v4-pro.

SECTION 07 Цитируемые метрики, источники и infra stack

  • KV-cache: 10 % memory vs V3.2 на 1M (Flash: 7 %)
  • Inference FLOPs: 27 % vs V3.2 в 1M scenario
  • Cost ratio: V4-Pro $0,03 vs Fable 5 $3,48 per task — 116×
  • Peak pricing: output $1,74/M = 1/8,6 Opus 4.8
  • Migration deadline: 2026-07-24 23:59 Пекин
  • Sampling: temperature=1.0, top_p=1.0

Официальные и сторонние источники — перепроверьте после обновлений:

DeepSeek API — официальная документация

arXiv:2606.19348 — технический paper DeepSeek V4

Artificial Analysis — cost/performance data

DeepSeek V4 GA — главный open-source milestone 2026 не потому, что бьёт Claude Fable 5 или GPT-5.6, а потому что даёт top-tier performance за fraction of cost. Но cloud LLM не компилирует Xcode, не отлаживает Metal shaders и не ведёт iOS certificate chain; виртуализированный macOS — EULA risk и 20–40 % throughput loss. Рабочий stack: V4 API для long-context inference и agent orchestration, физические узлы VPSNIX M4/M4 Pro для native compile и 7×24 deploy — 100 % оригинальное железо Apple, полный Root, zero hypervisor overhead. Тарифы на странице pricing; после обзора Kimi K3 фиксируйте compute в compliant physical environment, а не на одном API vendor.

SECTION 08 Часто задаваемые вопросы

Чем GA отличается от preview?

Та же архитектура; GA усилил agent, math и code, ввёл peak/off-peak. Старые endpoints offline 24 июля.

Когда действует peak tariff?

Будни 09:00–12:00 и 14:00–18:00 (Пекин) — ×2; вне окна off-peak rates.

V4-Pro или V4-Flash?

Flash для лёгкого routing и high frequency (output $0,28/M); Pro для reasoning и code (output $0,87/M, SWE-bench 80,6 %).

Можно self-host?

Да — MIT license, V4-Pro 1,6T требует large GPU cluster; большинству команд API экономичнее.