Если вы выбираете open-source LLM в 2026 для code agents или всё ещё держите production на deepseek-chat, DeepSeek V4 GA (релиз 20 июля 2026) меняет правила. Материал для AI-разработчиков и техлидов: низкоуровневая архитектура CSA/HCA/mHC/Muon, бенчмарки против GPT-5.6 и Claude Fable 5, peak/off-peak billing и миграция API до 24 июля. Вывод заранее: V4 пока не обгоняет closed-source флагманы, но даёт лучшую open-source производительность за 1/10–1/100 стоимости; peak-тарифы удваивают счёт, но $0,87/M output остаётся конкурентным.
SECTION 01 Три риска при запуске DeepSeek V4 GA
- Legacy endpoints отключаются:
deepseek-chatиdeepseek-reasonerперестанут работать 24 июля 2026, 23:59 (Пекин) — немигрированный production упадёт мгновенно. - Первый peak/off-peak billing: будни 09:00–12:00 и 14:00–18:00 (Пекин) — тариф ×2; 24/7 pipeline без scheduling раздует invoice.
- Cloud API не заменяет build chain: даже V4-Pro не собирает стабильно на виртуализированном macOS; см. сравнение аренды и покупки Mac mini M4.
- Preview vs GA: архитектура та же, но GA усилил agent, math и code generation — оценивайте по новым тарифам, а не по апрельской preview.
SECTION 02 Timeline: от preview к GA 20 июля 2026
| Дата | Событие |
|---|---|
| 2026-04-24 | V4 preview + open source (MIT): V4-Pro (1,6T) и V4-Flash (284B) |
| 2026-05 | Production tuning Flash и Pro, API в general availability |
| 2026-06 | V4-Pro output −75 % навсегда до $0,87/M tokens |
| 2026-06-29 | Email всем API-пользователям: GA в середине июля, первое раскрытие peak/off-peak |
| 2026-07-19 | Gray access GA для избранных разработчиков, пресса о «полной версии завтра» |
| 2026-07-20 | GA официально live |
| 2026-07-24 | deepseek-chat и deepseek-reasoner offline навсегда |
Кратко: preview уже был сильным; GA доработал agent capabilities, math reasoning и code gen и ввёл дисциплинированную коммерциализацию — от «почти бесплатно» к предсказуемому billing.
SECTION 03 V4-Pro и V4-Flash: CSA, HCA, mHC, Muon и три режима inference
| Параметр | V4-Pro | V4-Flash |
|---|---|---|
| Всего параметров | 1,6 трлн (1,6T) | 284 млрд (284B) |
| Активных параметров/token | 49 млрд (49B) | 13 млрд (13B) |
| Слоёв Transformer | 61 | 43 |
| Контекстное окно | 1 000 000 tokens | 1 000 000 tokens |
| Max output | 384K tokens | 384K tokens |
| Точность | FP4 (experts) + FP8 (остальное) | FP4 + FP8 mixed |
| Pretraining | 33T+ tokens | 32T+ tokens |
| Лицензия | MIT | MIT |
V4 отказался от MLA (V2/V3) в пользу гибрида Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA). CSA: Softmax-gated pooling сжимает KV-последовательность ×4, FP4 «lightning indexer» делает top-k sparsity (Pro: top-1024, Flash: top-512), плюс sliding window 128 tokens. HCA: ×128 compression для global dense attention. На 1M контекста — 27 % inference FLOPs vs V3.2, KV-cache memory 10 % (Flash: 7 %).
Manifold-Constrained Hyper-Connections (mHC) стабилизируют 61-слойную сеть через 4-channel residual flow и doubly-stochastic matrix constraints. Training на Muon optimizer (Newton-Schulz orthogonalization gradients) вместо AdamW — быстрее и стабильнее сходимость на deep stack.
| Режим | Механика | Use case |
|---|---|---|
| Non-think | Без chain-of-thought, минимальная latency | Простые Q&A, routing |
| Think High | Explicit reasoning (thinking tags) | Средняя сложность, code debug |
| Think Max | Max reasoning depth, контекст 384K+ | Math, long-chain agents |
Рекомендуемые sampling params: temperature=1.0, top_p=1.0 (все режимы).
SECTION 04 Benchmarks: SWE-bench 80,6 % и cost gap 116×
| Бенчмарк | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % | 96,0 % | не опубликован отдельно | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified — реальные GitHub bugfix tasks; 80,6 % — open-source record, паритет с Gemini 3.1 Pro. По Artificial Analysis, Claude Fable 5 в Strategy & Ops index стоит $3,48 за run (50 points), V4-Pro — $0,03 (38 points). Fable 5 дороже в 116×, score выше лишь на ~12 points (~31 %).
SECTION 05 GPT-5.6 / Claude Fable 5 и таблица peak/off-peak
| Измерение | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source / self-host | MIT | Нет | Нет |
| Контекст | 1M tokens | не раскрыт | 1M tokens |
| API output (off-peak) | $0,87/M | ~$15/M | $50/M |
| API output (peak) | $1,74/M | — | — |
| Code capability | Очень сильный (близко к Fable 5) | Очень сильный | Лидер |
| Data privacy | Private deployment | Cloud only | Cloud only |
Матрица сценариев: budget / high frequency / self-host → V4-Pro или Flash; max code quality → Claude Fable 5; hard math → GPT-5.6 Sol/Ultra; massive logs → V4-Flash (cache hit input $0,0028/M). Контекст open-source landscape: обзор Kimi K3 (2,8T).
| Модель | Позиция | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache hit) | ¥0,025 / $0,0035 / 1M | ×2 |
| V4-Pro | Input (cache miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 / 1M |
| V4-Pro | Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 / 1M |
| V4-Flash | Input (cache hit) | ¥0,02 / $0,0028 / 1M | ×2 |
| V4-Flash | Input (cache miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 / 1M |
| V4-Flash | Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 / 1M |
Оптимизация: batch jobs после 18:00 или до 09:00; Prompt Cache для hit rate; простой routing на Flash, heavy reasoning на Pro. Даже в peak V4-Pro output $1,74/M — в 8,6× дешевле Claude Opus 4.8 ($15/M).
SECTION 06 Миграция API до 24 июля: шесть шагов и Python
Deadline: deepseek-chat и deepseek-reasoner offline 24 июля 2026, 15:59 UTC (23:59 Пекин).
| Старая модель | Новая модель | Примечание |
|---|---|---|
deepseek-chat |
deepseek-v4-flash (Non-think) |
Быстро, лёгкие задачи |
deepseek-reasoner |
deepseek-v4-flash (Think mode) |
или upgrade на deepseek-v4-pro |
- Grep по codebase: repos, CI, env vars на
deepseek-chat/deepseek-reasoner. - Выбор target model: лёгкий dialog →
deepseek-v4-flash; complex reasoning →deepseek-v4-pro. - Обновить OpenAI SDK: менять только
model,base_url=https://api.deepseek.comбез изменений. - Thinking mode (optional): через
extra_body— заменаdeepseek-reasoner. - Staging load test: latency, token billing, peak/off-peak invoice.
- Canary rollout до 24.07: switch production, monitor error rate; DeepSeek шлёт email за 24 ч до pricing changes.
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Проанализируй этот Swift-код на узкие места производительности..."}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 поддерживает OpenAI ChatCompletions и Anthropic Messages; в Anthropic SDK base_url тот же, model → deepseek-v4-pro.
SECTION 07 Цитируемые метрики, источники и infra stack
- KV-cache: 10 % memory vs V3.2 на 1M (Flash: 7 %)
- Inference FLOPs: 27 % vs V3.2 в 1M scenario
- Cost ratio: V4-Pro $0,03 vs Fable 5 $3,48 per task — 116×
- Peak pricing: output $1,74/M = 1/8,6 Opus 4.8
- Migration deadline: 2026-07-24 23:59 Пекин
- Sampling: temperature=1.0, top_p=1.0
Официальные и сторонние источники — перепроверьте после обновлений:
DeepSeek API — официальная документация
arXiv:2606.19348 — технический paper DeepSeek V4
Artificial Analysis — cost/performance data
DeepSeek V4 GA — главный open-source milestone 2026 не потому, что бьёт Claude Fable 5 или GPT-5.6, а потому что даёт top-tier performance за fraction of cost. Но cloud LLM не компилирует Xcode, не отлаживает Metal shaders и не ведёт iOS certificate chain; виртуализированный macOS — EULA risk и 20–40 % throughput loss. Рабочий stack: V4 API для long-context inference и agent orchestration, физические узлы VPSNIX M4/M4 Pro для native compile и 7×24 deploy — 100 % оригинальное железо Apple, полный Root, zero hypervisor overhead. Тарифы на странице pricing; после обзора Kimi K3 фиксируйте compute в compliant physical environment, а не на одном API vendor.
SECTION 08 Часто задаваемые вопросы
Чем GA отличается от preview?
Та же архитектура; GA усилил agent, math и code, ввёл peak/off-peak. Старые endpoints offline 24 июля.
Когда действует peak tariff?
Будни 09:00–12:00 и 14:00–18:00 (Пекин) — ×2; вне окна off-peak rates.
V4-Pro или V4-Flash?
Flash для лёгкого routing и high frequency (output $0,28/M); Pro для reasoning и code (output $0,87/M, SWE-bench 80,6 %).
Можно self-host?
Да — MIT license, V4-Pro 1,6T требует large GPU cluster; большинству команд API экономичнее.