Если вы отслеживаете kimi k3 open weights, планируете миграцию с closed API или оцениваете expert-parallelism под MoE на 2,8 трлн параметров — этот материал собирает инженерную картину до публикации чекпоинтов на Hugging Face. Moonshot AI 27 июля 2026 выложит полные веса Kimi K3 (1 048 576 токенов контекста) под Modified MIT; API и клиенты Kimi работают с 16 июля. Вывод: K3 не обгоняет Claude Fable 5 по Artificial Analysis Intelligence Index (57,1 против 59,9), но даёт near-frontier inference при ~⅓ стоимости задачи, плюс скачиваемые веса и контекст 1M, который closed-вендор не отдаёт на ваш кластер.
SECTION 01 Почему open weights K3 ломают ожидания даже у опытных ML-инженеров
- Два релиза — одна модель: 16 июля — API/Kimi App/Kimi Work/Kimi Code; 27 июля — файлы весов и tech report. Смешивание дат убивает SEO и планирование capacity.
- Open weights ≠ open source: Чекпоинты да, training code и датасеты — нет. Для compliance и r/LocalLLaMA формулировка критична.
- Self-host без цифр — маркетинг: INT4 ~1,4 TB только на диск; официально — super-node с 64+ ускорителями, expert + tensor parallelism. Одна RTX не масштабируется.
- Harness-зависимость: Moonshot признала чувствительность к возврату reasoning-трейса в промпт и гиперактивность на ambiguous intent — cross-vendor сравнения требуют даты прогона.
- Closed лидирует в polish: GDPval v2 Elo и DeepSWE — у Fable 5 и GPT-5.6 Sol; K3 доминирует на длинном коде и automation — выбирайте workload, не заголовок.
SECTION 02 Хронология релиза Kimi K3 и полная таблица спецификаций
| Дата | Событие |
|---|---|
| 2026-07-16 | Старт API, Kimi App, Kimi Work, Kimi Code; Artificial Analysis публикует независимую оценку в тот же день |
| 2026-07-17 | Открытие WAIC в Шанхае; Xinhua позиционирует K3 как национальный AI-рубеж |
| 2026-07-27 | Полные веса 2,8T на Hugging Face (Modified MIT) + technical report (архитектура, обучение, eval) |
| Параметр | Значение |
|---|---|
| Всего параметров | 2,8 трлн (2,8T) — крупнейшая open-weight модель на сегодня |
| Архитектура | Sparse MoE — Stable LatentMoE; 896 experts, 16 активных на токен |
| Attention | Kimi Delta Attention (KDA, hybrid linear) + Attention Residuals (AttnRes) + Gated MLA |
| Контекст | 1 048 576 токенов (~1M) |
| Модальности | Native vision (текст + изображение); продуктовый tier — video; выход — текст |
| Формат весов | MXFP4 weights + MXFP8 activations (native low-precision training) |
| Эффективность scaling | ~2,5× vs K2 при равном compute (официально) |
| Стабильность обучения | Quantile Balancing (expert routing), Per-Head Muon optimizer, SiTU activation |
| Long-context decode | KDA до 6,3× ускорения decode на контексте 1M токенов |
K3 — первый open-weight класса ~3T: прямой вызов premium closed-API по цене, а не заявление о победе над каждым frontier-бенчмарком.
SECTION 03 Бенчмарки Kimi K3 vs Claude Fable 5 и GPT-5.6 Sol
Artificial Analysis Intelligence Index (прогон 16 июля 2026):
| Модель | Балл | Ранг |
|---|---|---|
| Claude Fable 5 | 59,9 | 1 |
| GPT-5.6 Sol | 58,9 | 2 |
| Kimi K3 | 57,1 | 3 / 189 |
Где K3 лидирует или догоняет: Frontend Code Arena #1 (слепое предпочтение dev на UI-коде); Automation Bench и SpreadsheetBench 2 #1; BrowseComp 91,2 (#1, до 90,4+ со стратегией 1M без compression); SWE Marathon 42,0 (GPT-5.5 и GLM-5.2 падают в teens); Terminal Bench 2.1 88,3 (≈ Sol 88,8); Program Bench 77,8; FrontierSWE 81,2 (выше Sol 71,3, ниже Fable 5 86,6).
Где K3 отстаёт: GDPval v2 Elo 1668–1687 vs Fable 5 1760 и Sol 1748; DeepSWE 67,5 vs Sol 73,0; рост hallucination rate vs K2.6 (официально); Reddit — больше галлюцинаций в self-hosted apps; диалоговый polish и variance одной сессии — за closed-флагманами.
Архитектурный разбор KDA и Stable LatentMoE — в обзоре Kimi K3 как open-source LLM; альтернатива из той же волны — анализ релиза DeepSeek V4 GA.
SECTION 04 Тарифы API Kimi K3 и реальная стоимость с кэшем
| Статья | Цена |
|---|---|
| Input (cache miss) | $3,00 |
| Input (cache hit, auto) | $0,30 |
| Output | $15,00 |
Максимум среди китайских LLM-вендоров, но далеко ниже Claude Opus 4.8 на типовой задаче. Artificial Analysis: $0,94 за task — на 9,4% ниже GPT-5.6 Sol и на 65,8% ниже Claude Fable 5. Coding-агенты сообщают >90% cache hit — effective spend существенно ниже list price.
SECTION 05 Open weights или open source: что именно отдаёт Moonshot 27 июля
27 июля — полные чекпоинты 2,8T в Hugging Face org Moonshot под Modified MIT (полный текст лицензии — в день релиза). Tech report: архитектура, training pipeline, evaluation. Ожидается vLLM с KDA и prefix caching; Ollama/GGUF — по паттерну K2, с задержкой сообщества.
Для инженеров: это open-weight — лицензированные checkpoints для inference и fine-tune в рамках LICENSE. Не open source в смысле публичного training code и data. Запросы вроде is kimi k3 open source требуют этой оговорки в body copy.
SECTION 06 Локальный запуск Kimi K3: железо и чеклист на день релиза
Честный ответ: не на consumer GPU. INT4 ~1,4 TB. Официально — super-node, 64+ accelerators, expert parallelism + tensor parallelism. Ориентир: K2.7 Code 1T — ~577 GB VRAM в INT4; K3 в 2,8× больше по параметрам.
Self-host оправдан при: жёстком data residency/offline, fine-tune на proprietary data или объёме вызовов, где owned hardware обходит API TCO. Для остальных — API $3/$15 за M токенов.
- Watch на Hugging Face org Moonshot AI до 27 июля — repo появится в первые минуты.
- Прочитать LICENSE целиком — Modified MIT ≠ стандартный MIT.
- Проверить шарды и quant: MXFP4 bundles, community INT4/GGUF от maintainers.
- Зафиксировать commit vLLM с KDA и prefix caching — до production pin.
- Сверить tech report с кластером: число accelerators, interconnect, стратегия parallelism.
- Независимо прогнать long-context eval на 1M decode — не только слайды маркетинга.
- TCO API vs self-host: электричество, сеть, ops, cache-hit для coding agents.
SECTION 07 Почему дроп весов 27 июля меняет индустрию
- Разрыв open vs closed сжался до единиц баллов на Intelligence Index — premium closed сложнее оправдать только «умом».
- Геополитика: K3 до WAIC 2026; месяцем раньше США кратко delist Anthropic Fable/Mythos (восстановлено 1 июля). Публичные веса нельзя «отозвать» регулятором — новый аргумент open-weight лобби.
- Волна CN-вендоров: Z.ai GLM-5.2, DeepSeek V4 Pro 1,6T, MiniMax — K3 пик цикла.
- Камбэк Moonshot: после DeepSeek R1 (2025, Moonshot — седьмой domestically) цепочка K2 → K2.5 → K3 восстановила доверие к open-weight roadmap.
SECTION 08 Цитируемые данные и первичные источники
- Параметры: 2,8T; 896 MoE experts, 16 active/token
- Контекст: 1 048 576 токенов
- Intelligence Index: K3 57,1 / Sol 58,9 / Fable 5 59,9 (AA, 16.07.2026)
- Cost per task: K3 $0,94 — на 65,8% ниже Fable 5
- API: $3 input miss / $0,30 cache hit / $15 output за M tokens
- Self-host storage: ~1,4 TB INT4; рекомендация 64+ accelerators
- License: Modified MIT (полный текст 27 июля)
- Coding: Frontend Code Arena #1; SWE Marathon 42,0
Официальные и независимые ссылки — после обновлений upstream перепроверьте URL:
Moonshot AI — официальный tech-блог Kimi K3
Kimi Platform — документация API и pricing
Artificial Analysis — Intelligence Index и cost benchmarks (16.07.2026)
Open weights K3 меняют экономику near-frontier inference, но не компилируют Xcode-проекты, не подписывают iOS-бинарники и не отлаживают Metal shaders. Виртуализированный macOS добавляет EULA-риск и overhead гипервизора. Практичный production stack: K3 API (или будущий self-hosted endpoint) для million-token reasoning и agent orchestration + физические узлы VPSNIX M4/M4 Pro для native Apple Silicon builds: 100% Apple hardware, root, zero hypervisor tax, elastic daily/monthly billing. Смотрите тарифы и держите long-running agents на compliant physical infra, а не на одной кривой vendor API.
SECTION 09 Часто задаваемые вопросы
Когда выйдут веса Kimi K3?
27 июля 2026. API и приложения Kimi — с 16 июля; скачиваемые checkpoints и tech report — 27-го на Hugging Face под Modified MIT.
Kimi K3 — это open source?
Open-weight релиз: лицензированные checkpoints. Training code и datasets в дроп 27 июля не входят. В заголовках — «open weights», в тексте — нюанс.
Сколько стоит Kimi K3?
API: $3/M input (cache miss), $0,30/M (cache hit), $15/M output. Artificial Analysis — ~$0,94 за representative task, на 65,8% ниже Claude Fable 5.
Можно ли запустить K3 на consumer GPU?
Нет. ~1,4 TB INT4 и guidance на 64+ accelerators в distributed super-node. Используйте API, если нет datacenter-scale железа.
K3 лучше Claude Fable 5 или GPT-5.6 Sol?
По aggregate Intelligence Index — нет (57,1 vs 59,9 и 58,9). Выигрывает отдельные coding/automation бенчи и стоит существенно дешевле за task. Выбор по workload.
Какая лицензия у Kimi K3?
Modified MIT; полный текст — в репозитории Hugging Face 27 июля. Прочитайте файл до commercial redistribution или fine-tune redistribution.