Главная / Блог / Kimi K3
ENGINEERING_BLOG · 2026.07.17

Kimi K3: 2,8 трлн параметров — open-source рекорд 2026

KIMI K3 · ВСЕГО ПАРАМЕТРОВ
2.8T

Примерно на 75 % больше DeepSeek V4 Pro (1,6T) — крупнейшая open-source модель на сегодня.

Если вы выбираете open-source LLM в 2026 для code generation или совмещаете длинные coding-сессии с разработкой под Apple, Kimi K3 от Moonshot AI (релиз 16 июля 2026) стоит поставить в shortlist. Материал для разработчиков и техлидов: MoE на 2,8 трлн параметров, три инженерных нововведения (KDA, AttnRes, Stable LatentMoE), бенчмарки против Claude Fable 5 и GPT-5.6 Sol, тарифы API и график open-source на 27 июля. Вывод заранее: K3 конкурирует с closed-source флагманами на длинном коде, но не заменяет Xcode-сборку и Metal-отладку — cloud API и нативный M4-узел дополняют друг друга.

SECTION 01 Три типичные ловушки при выборе LLM для кода

  • Контекстное окно на бумаге: Многие заявляют 200K+ токенов, но при анализе всего репозитория всё равно режут контекст. K3 даёт 1M токенов по стандартному тарифу — удобно для monorepo.
  • Бенчмарк ≠ продакшен: Высокий SWE на коротких задачах не гарантирует многочасовой coding. SWE Marathon ближе к реальности — K3 лидирует с 42,0.
  • API-модель не заменяет build-окружение: Даже сильный cloud LLM не подписывает и не собирает стабильно на виртуализированном macOS. См. сравнение аренды и покупки Mac mini M4.
  • Open-source обещание vs деплой: 2,8T параметров для production inference требуют 64+ ускорителей; до 27 июля остаются API и kimi.com.

SECTION 02 Что такое Kimi K3 и почему важен момент релиза

16 июля 2026 — без keynote: баннер в API-документации, техблог и сразу доступный model ID kimi-k3.

Кратко: Kimi K3 — крупнейшая open-source модель: 2,8 трлн (2,8T) параметров, ~+75 % к DeepSeek V4 Pro (1,6T), в 2,7× больше open-source модели Xiaomi (1,02T). Sparse MoE: 16 из 896 экспертов (sparsity 1,8 %); контекст 1M; native vision. Полные веса на Hugging Face с 27 июля 2026.

Ключевые характеристики Kimi K3
Параметр Значение
Всего параметров 2,8 трлн (2,8T)
Архитектура KDA + AttnRes + Stable LatentMoE
Активные эксперты 16 / 896 (sparsity 1,8 %)
Контекстное окно 1 048 576 токенов (1M)
Входные модальности Текст, изображение, видео
Тариф API $3 / $15 за 1M токенов (input/output)
Open-source веса 27 июля 2026

Стратегический контекст: Kimi 9 из 12 месяцев лидировала по размеру в open-source; релиз накануне WAIC 2026; ARR >$300M (июнь 2026), оценка $31,5B; доля API >70 %, международные платные пользователи +400 %.

SECTION 03 Три архитектурных нововведения: KDA, AttnRes, Stable LatentMoE

Kimi Delta Attention (KDA) — гибрид linear attention 3:1 (три linear-слоя, один full-attention). KV-cache −75 % по памяти; decode на 1M токенов до +6,3×; обходит full-attention baseline в коротком, длинном контексте и при RL-scaling.

Attention Residuals (AttnRes) — модифицированные depth-residual с selective retrieval ранних layer representations. Moonshot заявляет ~+25 % training efficiency при <2 % extra compute.

Stable LatentMoE — при 896 экспертах и 16 активных: Quantile Balancing, Per-Head Muon, Sigmoid Tanh Unit (SiTU) и Gated MLA. Scaling efficiency ~2,5× vs Kimi K2.

KDA работает как умный индекс: быстрые lookup большую часть времени, точный full recall — когда нужен глобальный контекст.

SECTION 04 Бенчмарки: Kimi K3 vs Claude Fable 5 vs GPT-5.6 Sol

Ключевые бенчмарки Moonshot (16.07.2026)
Бенчмарк Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE 67,5 70,0 73,0 59,0
Program Bench 77,8 76,8 77,6 71,9
Terminal Bench 2.1 88,3 84,6 88,8 84,6
FrontierSWE 81,2 86,6 71,3 66,7
SWE Marathon 42,0 35,0 39,0 40,0
BrowseComp 91,2 88,0 90,4 84,3
OmniDocBench 91,1 89,8 85,8 87,9
GPQA-Diamond 93,5 92,6 94,1 91,0

Интерпретация: SWE Marathon — sustained coding, K3 лидирует. Program Bench и OmniDocBench также на первом месте. Intelligence Index v4.1: K3 = 57,1, 4-е место после Claude Fable 5 (59,9) и GPT-5.6 Sol (58,9). Важно: данные вендора; разные inference harness (Kimi Code, Codex, Claude Code) — независимая репликация в процессе.

SECTION 05 Сравнение тарифов и шесть шагов подключения Kimi K3

Тарифы API ($/1M токенов)
Модель Input Output Cache hit input Контекст
Kimi K3 $3,00 $15,00 $0,30 1M
Claude Sonnet 5 $3,00 $15,00 200K
Claude Opus 4.8 $5,00 $25,00 200K
GPT-5.5 $5,00 $30,00 400K
DeepSeek V4 Pro $1,74 $3,48 $0,145 128K
Kimi K2.6 $0,95 $4,00 $0,16 256K

K3 на уровне Claude Sonnet 5 ($3/$15), но контекст в 5× шире; cache hit от $0,30/M — в coding часто >90 % hit rate. Китайский API: ¥20/M input; kimi.com — бесплатный tier.

  1. Веб без кода: kimi.com, регистрация (Google login), K3 по умолчанию на max inference.
  2. Moonshot API key: создать на platform.kimi.ai, проверить баланс и rate limits.
  3. OpenAI-compatible client: base_url=https://api.moonshot.ai/v1, model kimi-k3.
  4. Проверка первого вызова: короткий prompt, сверить billing и latency.
  5. (Опционально) OpenRouter: ID moonshotai/kimi-k3, официальные цены без наценки, 1M контекст.
  6. Отметить 27 июля: следить за Hugging Face repo; оценить vLLM/SGLang quantization и порог self-hosting (64+ GPU).
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Проанализируй этот код на узкие места производительности..."}]
)

SECTION 06 Матрица сценариев, open-source график и цитируемые данные

Выбор модели по сценарию
Сценарий Рекомендация Причина
Длинные coding-сессии Kimi K3 SWE Marathon лидер, максимальный контекст
Сложные repo-level bugfix Claude Fable 5 FrontierSWE с большим отрывом
Terminal/toolchain agents GPT-5.6 Sol Terminal Bench лидирует
Длинные документы / multimodal Kimi K3 OmniDocBench 1-е место
Минимальный бюджет DeepSeek V4 Pro Output $3,48/M
Self-hosting (после 27.07) Kimi K3 Сильнейшие open-source веса

Цитируемые технические данные:

  • Параметры: 2,8T total, MoE 896 experts, 16 active (1,8 % sparsity)
  • KDA: KV-cache −75 %, decode 1M +6,3×
  • AttnRes: training +25 %, extra compute <2 %
  • vs K2: scaling efficiency +2,5×
  • Intelligence Index v4.1: K3 = 57,1, 4-е место глобально
  • ARR / valuation: >$300M ARR (июнь 2026), $31,5B pre-money
  • Даты: WAIC 17–20.07 → 27.07 полные веса на Hugging Face

Официальные и сторонние источники — перепроверьте после обновлений:

Moonshot AI — технический блог Kimi K3

Kimi API Platform — тарифы и quickstart

Artificial Analysis — Intelligence Index v4.1

K3 доказывает, что open-source может бросать вызов closed-source флагманам — но cloud LLM не компилирует Xcode, не отлаживает Metal-шейдеры и не ведёт iOS certificate chain. Виртуализированный macOS — EULA-риски и 20–40 % потери производительности. Рабочий стек: K3 API для длинного кода и документов, физические узлы VPSNIX M4/M4 Pro для native compile и агентов 7×24 — 100 % оригинальное железо Apple, полный Root, zero hypervisor overhead, посуточная аренда. Тарифы на странице pricing; если следите за иском Apple против OpenAI, фиксируйте compute в compliant physical environment, а не в сомнительной виртуализации.

SECTION 07 Часто задаваемые вопросы

Можно ли использовать Kimi K3 бесплатно?

Да — free tier на kimi.com с K3 (пока только max inference). API: $3/$15 за 1M токенов.

Можно ли запустить Kimi K3 локально?

До 27 июля — нет. После релиза весов production inference требует 64+ GPU — не для ноутбука.

K3 или DeepSeek V4 Pro?

K3: почти 2× параметров (2,8T vs 1,6T), 1M vs 128K контекст, сильнее бенчмарки. DeepSeek: output $3,48/M — значительно дешевле.

Нужен ли контекст в 1M токенов?

Для анализа всего репозитория, длинных юридических/научных документов и long-term agent memory — да; K3 не наценивает длину контекста.