Главная / Блог / K3 веса
ENGINEERING_BLOG · 2026.07.22

Kimi K3 open weights: релиз 27 июля, бенчмарки и инфраструктура self-host

KIMI K3 · ДРОП ВЕСОВ
27ИЮЛ

2,8T параметров под Modified MIT — крупнейший запланированный open-weight релиз в истории.

Если вы отслеживаете kimi k3 open weights, планируете миграцию с closed API или оцениваете expert-parallelism под MoE на 2,8 трлн параметров — этот материал собирает инженерную картину до публикации чекпоинтов на Hugging Face. Moonshot AI 27 июля 2026 выложит полные веса Kimi K3 (1 048 576 токенов контекста) под Modified MIT; API и клиенты Kimi работают с 16 июля. Вывод: K3 не обгоняет Claude Fable 5 по Artificial Analysis Intelligence Index (57,1 против 59,9), но даёт near-frontier inference при ~⅓ стоимости задачи, плюс скачиваемые веса и контекст 1M, который closed-вендор не отдаёт на ваш кластер.

SECTION 01 Почему open weights K3 ломают ожидания даже у опытных ML-инженеров

  • Два релиза — одна модель: 16 июля — API/Kimi App/Kimi Work/Kimi Code; 27 июля — файлы весов и tech report. Смешивание дат убивает SEO и планирование capacity.
  • Open weights ≠ open source: Чекпоинты да, training code и датасеты — нет. Для compliance и r/LocalLLaMA формулировка критична.
  • Self-host без цифр — маркетинг: INT4 ~1,4 TB только на диск; официально — super-node с 64+ ускорителями, expert + tensor parallelism. Одна RTX не масштабируется.
  • Harness-зависимость: Moonshot признала чувствительность к возврату reasoning-трейса в промпт и гиперактивность на ambiguous intent — cross-vendor сравнения требуют даты прогона.
  • Closed лидирует в polish: GDPval v2 Elo и DeepSWE — у Fable 5 и GPT-5.6 Sol; K3 доминирует на длинном коде и automation — выбирайте workload, не заголовок.

SECTION 02 Хронология релиза Kimi K3 и полная таблица спецификаций

Ключевые вехи Kimi K3
Дата Событие
2026-07-16 Старт API, Kimi App, Kimi Work, Kimi Code; Artificial Analysis публикует независимую оценку в тот же день
2026-07-17 Открытие WAIC в Шанхае; Xinhua позиционирует K3 как национальный AI-рубеж
2026-07-27 Полные веса 2,8T на Hugging Face (Modified MIT) + technical report (архитектура, обучение, eval)
Спецификации Kimi K3
Параметр Значение
Всего параметров 2,8 трлн (2,8T) — крупнейшая open-weight модель на сегодня
Архитектура Sparse MoE — Stable LatentMoE; 896 experts, 16 активных на токен
Attention Kimi Delta Attention (KDA, hybrid linear) + Attention Residuals (AttnRes) + Gated MLA
Контекст 1 048 576 токенов (~1M)
Модальности Native vision (текст + изображение); продуктовый tier — video; выход — текст
Формат весов MXFP4 weights + MXFP8 activations (native low-precision training)
Эффективность scaling ~2,5× vs K2 при равном compute (официально)
Стабильность обучения Quantile Balancing (expert routing), Per-Head Muon optimizer, SiTU activation
Long-context decode KDA до 6,3× ускорения decode на контексте 1M токенов

K3 — первый open-weight класса ~3T: прямой вызов premium closed-API по цене, а не заявление о победе над каждым frontier-бенчмарком.

SECTION 03 Бенчмарки Kimi K3 vs Claude Fable 5 и GPT-5.6 Sol

Artificial Analysis Intelligence Index (прогон 16 июля 2026):

Сводный Intelligence Index (Artificial Analysis, 16.07.2026)
Модель Балл Ранг
Claude Fable 5 59,9 1
GPT-5.6 Sol 58,9 2
Kimi K3 57,1 3 / 189

Где K3 лидирует или догоняет: Frontend Code Arena #1 (слепое предпочтение dev на UI-коде); Automation Bench и SpreadsheetBench 2 #1; BrowseComp 91,2 (#1, до 90,4+ со стратегией 1M без compression); SWE Marathon 42,0 (GPT-5.5 и GLM-5.2 падают в teens); Terminal Bench 2.1 88,3 (≈ Sol 88,8); Program Bench 77,8; FrontierSWE 81,2 (выше Sol 71,3, ниже Fable 5 86,6).

Где K3 отстаёт: GDPval v2 Elo 1668–1687 vs Fable 5 1760 и Sol 1748; DeepSWE 67,5 vs Sol 73,0; рост hallucination rate vs K2.6 (официально); Reddit — больше галлюцинаций в self-hosted apps; диалоговый polish и variance одной сессии — за closed-флагманами.

Архитектурный разбор KDA и Stable LatentMoE — в обзоре Kimi K3 как open-source LLM; альтернатива из той же волны — анализ релиза DeepSeek V4 GA.

SECTION 04 Тарифы API Kimi K3 и реальная стоимость с кэшем

API Kimi K3 (USD за 1M токенов)
Статья Цена
Input (cache miss) $3,00
Input (cache hit, auto) $0,30
Output $15,00

Максимум среди китайских LLM-вендоров, но далеко ниже Claude Opus 4.8 на типовой задаче. Artificial Analysis: $0,94 за task — на 9,4% ниже GPT-5.6 Sol и на 65,8% ниже Claude Fable 5. Coding-агенты сообщают >90% cache hit — effective spend существенно ниже list price.

SECTION 05 Open weights или open source: что именно отдаёт Moonshot 27 июля

27 июля — полные чекпоинты 2,8T в Hugging Face org Moonshot под Modified MIT (полный текст лицензии — в день релиза). Tech report: архитектура, training pipeline, evaluation. Ожидается vLLM с KDA и prefix caching; Ollama/GGUF — по паттерну K2, с задержкой сообщества.

Для инженеров: это open-weight — лицензированные checkpoints для inference и fine-tune в рамках LICENSE. Не open source в смысле публичного training code и data. Запросы вроде is kimi k3 open source требуют этой оговорки в body copy.

SECTION 06 Локальный запуск Kimi K3: железо и чеклист на день релиза

Честный ответ: не на consumer GPU. INT4 ~1,4 TB. Официально — super-node, 64+ accelerators, expert parallelism + tensor parallelism. Ориентир: K2.7 Code 1T — ~577 GB VRAM в INT4; K3 в 2,8× больше по параметрам.

Self-host оправдан при: жёстком data residency/offline, fine-tune на proprietary data или объёме вызовов, где owned hardware обходит API TCO. Для остальных — API $3/$15 за M токенов.

  1. Watch на Hugging Face org Moonshot AI до 27 июля — repo появится в первые минуты.
  2. Прочитать LICENSE целиком — Modified MIT ≠ стандартный MIT.
  3. Проверить шарды и quant: MXFP4 bundles, community INT4/GGUF от maintainers.
  4. Зафиксировать commit vLLM с KDA и prefix caching — до production pin.
  5. Сверить tech report с кластером: число accelerators, interconnect, стратегия parallelism.
  6. Независимо прогнать long-context eval на 1M decode — не только слайды маркетинга.
  7. TCO API vs self-host: электричество, сеть, ops, cache-hit для coding agents.

SECTION 07 Почему дроп весов 27 июля меняет индустрию

  • Разрыв open vs closed сжался до единиц баллов на Intelligence Index — premium closed сложнее оправдать только «умом».
  • Геополитика: K3 до WAIC 2026; месяцем раньше США кратко delist Anthropic Fable/Mythos (восстановлено 1 июля). Публичные веса нельзя «отозвать» регулятором — новый аргумент open-weight лобби.
  • Волна CN-вендоров: Z.ai GLM-5.2, DeepSeek V4 Pro 1,6T, MiniMax — K3 пик цикла.
  • Камбэк Moonshot: после DeepSeek R1 (2025, Moonshot — седьмой domestically) цепочка K2 → K2.5 → K3 восстановила доверие к open-weight roadmap.

SECTION 08 Цитируемые данные и первичные источники

  • Параметры: 2,8T; 896 MoE experts, 16 active/token
  • Контекст: 1 048 576 токенов
  • Intelligence Index: K3 57,1 / Sol 58,9 / Fable 5 59,9 (AA, 16.07.2026)
  • Cost per task: K3 $0,94 — на 65,8% ниже Fable 5
  • API: $3 input miss / $0,30 cache hit / $15 output за M tokens
  • Self-host storage: ~1,4 TB INT4; рекомендация 64+ accelerators
  • License: Modified MIT (полный текст 27 июля)
  • Coding: Frontend Code Arena #1; SWE Marathon 42,0

Официальные и независимые ссылки — после обновлений upstream перепроверьте URL:

Moonshot AI — официальный tech-блог Kimi K3

Kimi Platform — документация API и pricing

Artificial Analysis — Intelligence Index и cost benchmarks (16.07.2026)

Open weights K3 меняют экономику near-frontier inference, но не компилируют Xcode-проекты, не подписывают iOS-бинарники и не отлаживают Metal shaders. Виртуализированный macOS добавляет EULA-риск и overhead гипервизора. Практичный production stack: K3 API (или будущий self-hosted endpoint) для million-token reasoning и agent orchestration + физические узлы VPSNIX M4/M4 Pro для native Apple Silicon builds: 100% Apple hardware, root, zero hypervisor tax, elastic daily/monthly billing. Смотрите тарифы и держите long-running agents на compliant physical infra, а не на одной кривой vendor API.

SECTION 09 Часто задаваемые вопросы

Когда выйдут веса Kimi K3?

27 июля 2026. API и приложения Kimi — с 16 июля; скачиваемые checkpoints и tech report — 27-го на Hugging Face под Modified MIT.

Kimi K3 — это open source?

Open-weight релиз: лицензированные checkpoints. Training code и datasets в дроп 27 июля не входят. В заголовках — «open weights», в тексте — нюанс.

Сколько стоит Kimi K3?

API: $3/M input (cache miss), $0,30/M (cache hit), $15/M output. Artificial Analysis — ~$0,94 за representative task, на 65,8% ниже Claude Fable 5.

Можно ли запустить K3 на consumer GPU?

Нет. ~1,4 TB INT4 и guidance на 64+ accelerators в distributed super-node. Используйте API, если нет datacenter-scale железа.

K3 лучше Claude Fable 5 или GPT-5.6 Sol?

По aggregate Intelligence Index — нет (57,1 vs 59,9 и 58,9). Выигрывает отдельные coding/automation бенчи и стоит существенно дешевле за task. Выбор по workload.

Какая лицензия у Kimi K3?

Modified MIT; полный текст — в репозитории Hugging Face 27 июля. Прочитайте файл до commercial redistribution или fine-tune redistribution.