首页 / 博客 / Kimi K3
ENGINEERING_BLOG · 2026.07.17

Kimi K3 深度评测:2.8 万亿参数开源大模型新纪录

KIMI K3 · 总参数量
2.8T

超越 DeepSeek V4 Pro(1.6T)近 75%,迄今全球最大开源 AI 模型。

如果你正在评估 2026 年开源大模型选型、或需要兼顾长代码任务与 Apple 生态开发,2026 年 7 月 16 日月之暗面(Moonshot AI)悄然上线的 Kimi K3 值得立刻纳入对比清单。本文面向 AI 开发者与技术决策者,系统梳理 2.8 万亿参数 MoE 架构、Kimi Delta Attention 三大工程创新、与 Claude Fable 5 / GPT-5.6 Sol 的基准对照、$3/$15 定价与 7 月 27 日完整权重开源时间表。结论先行:K3 在编程长任务与文档理解上对标闭源旗舰,但 iOS/macOS 编译链与 Metal 调试仍需原生 Apple Silicon 物理机——云端 API 与本地 M4 节点应组合使用。

SECTION 01 选大模型写代码时,开发者常踩的三类坑

  • 上下文窗口虚标:许多模型宣称 200K+ 上下文,长 Repo 分析时仍频繁截断;K3 提供 100 万 token 窗口且按标准价计费,适合整库级推理。
  • 基准分数与真实场景脱节:短任务 SWE 分数高不代表能连续写代码数小时;SWE Marathon 才是「实际写代码」最接近的测试之一,K3 以 42.0 领跑。
  • API 模型无法替代原生编译环境:再强的云端 LLM 也不能在 Hypervisor 虚拟 macOS 上稳定跑 Xcode 签名与 Metal 调试;与Mac Mini M4 租 vs 买对比中讨论的物理节点需求形成互补。
  • 开源承诺与可部署性落差:参数规模越大,自托管门槛越高——K3 生产级部署需 64 张以上加速卡,7 月 27 日前只能走 API 或 Kimi.com 消费端。

SECTION 02 Kimi K3 是什么?发布背景为何重要

2026 年 7 月 16 日深夜,月之暗面在 API 文档顶部挂出「Kimi K3 已上线」横幅——无大型发布会,只有技术博客、定价页与可立即调用的模型 ID kimi-k3

一句话定义:Kimi K3 是目前全球参数规模最大的开源 AI 模型——2.8 万亿(2.8T)参数,超越 DeepSeek V4 Pro(1.6T)近 75%,是小米开源模型(1.02T)的 2.7 倍。采用稀疏 MoE 架构,推理时从 896 个专家中激活 16 个;配合 100 万 token 超长上下文与原生视觉理解,专为复杂编程、长文档推理与知识工作设计。完整权重将于 2026 年 7 月 27 日在 Hugging Face 开放。

Kimi K3 核心规格
维度 参数
总参数量 2.8 万亿(2.8T)
架构 KDA + AttnRes + Stable LatentMoE
激活专家 16 / 896(稀疏度 1.8%)
上下文窗口 1,048,576 tokens(1M)
输入模态 文本、图像、视频
API 定价 $3 / $15 每百万 token(输入/输出)
权重开源 2026 年 7 月 27 日

战略背景同样值得关注:过去 12 个月 Kimi 系列有 9 个月占据开源模型规模上限;发布时点恰在 2026 世界人工智能大会(WAIC)开幕前夜;截至 2026 年 6 月 ARR 已突破 3 亿美元,年内完成第 6 轮融资,投前估值 315 亿美元;API 收入占七成以上,海外付费用户增长 400%。

SECTION 03 三大架构创新:KDA、AttnRes 与 Stable LatentMoE

Kimi Delta Attention(KDA)——混合线性注意力机制,以 3:1 比例交替线性注意力层与全注意力层:3 个线性层处理局部序列(计算廉价),1 个全注意力层保留全局信息流。KV 缓存内存减少高达 75%;百万 token 上下文下解码速度提升高达 6.3 倍;短上下文、长上下文与强化学习扩展场景均超越纯全注意力基线。

Attention Residuals(AttnRes)——改造深度维度残差连接,引入选择性检索:模型可跨越深度直接拉取更早层的高价值表征,而非均匀稀释早期信号。月之暗面报告约 25% 训练效率提升,额外计算开销不足 2%。

Stable LatentMoE——在 896 专家、每次仅激活 16 个的极端稀疏度下,配套 Quantile Balancing(从路由器得分分位数推导专家分配)、Per-Head Muon(逐注意力头独立优化)、Sigmoid Tanh Unit(SiTU)与 Gated MLA。相较 Kimi K2,整体扩展效率提升约 2.5 倍。

如果全注意力像让一个人同时记住所有对话细节,KDA 更像高效秘书——大部分时候用快速索引,关键时刻再精准回忆。

SECTION 04 基准测试:Kimi K3 vs Claude Fable 5 vs GPT-5.6 Sol

月之暗面自报核心基准(2026-07-16)
基准 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE 67.5 70.0 73.0 59.0
Program Bench 77.8 76.8 77.6 71.9
Terminal Bench 2.1 88.3 84.6 88.8 84.6
FrontierSWE 81.2 86.6 71.3 66.7
SWE Marathon 42.0 35.0 39.0 40.0
BrowseComp 91.2 88.0 90.4 84.3
OmniDocBench 91.1 89.8 85.8 87.9
GPQA-Diamond 93.5 92.6 94.1 91.0

解读要点:SWE Marathon 测试持续性长代码工作,K3 以 42.0 大幅领先;Program Bench 与 OmniDocBench 均列第一;Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,紧随 Claude Fable 5(59.9)与 GPT-5.6 Sol(58.9)。注意:上述为月之暗面自报数据,各模型使用不同推理 harness(K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code),独立第三方复现仍在进行中。

SECTION 05 定价对比与六种接入 Kimi K3 的实操步骤

主流模型 API 定价对照($/M token)
模型 输入 输出 缓存命中输入 上下文
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00 $15.00 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K

K3 与 Claude Sonnet 5 标准价持平($3/$15),但上下文窗口为其 5 倍;缓存命中低至 $0.30/M,编程场景缓存命中率超 90%。国内 API:¥20/M 输入、¥100/M 输出、缓存命中 ¥2/M;Kimi.com 免费账号可用,预付费 ¥199 起(优惠截至 8 月 11 日)。

  1. 网页/App 零代码体验:访问 kimi.com,注册账号(支持 Google 登录),K3 默认以最大推理力度运行。
  2. 申请 Moonshot API Key:在 platform.kimi.ai 创建密钥,确认账户余额与速率限制。
  3. 配置 OpenAI 兼容客户端:设置 base_url=https://api.moonshot.ai/v1,模型 ID 填 kimi-k3
  4. 验证首次调用:发送短 prompt 确认 token 计费与响应延迟符合预期。
  5. (可选)接入 OpenRouter:模型 ID moonshotai/kimi-k3,官方定价无加价,保留 1M 上下文。
  6. 标记 7 月 27 日权重发布:关注 Hugging Face 官方仓库,届时评估 vLLM / SGLang 量化版本与自托管门槛(需 64+ 加速卡超节点)。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "分析这段代码的性能瓶颈..."}]
)

SECTION 06 场景选型、开源时间表与可引用数据

按场景选择模型
场景 推荐 原因
持续性长代码任务 Kimi K3 SWE Marathon 第一,上下文最长
复杂 Repo 级修 Bug Claude Fable 5 FrontierSWE 大幅领先
终端/工具链 Agent GPT-5.6 Sol Terminal Bench 领先
超长文档/多模态理解 Kimi K3 OmniDocBench 第一
成本敏感 DeepSeek V4 Pro 输出 $3.48/M
开源自部署(7/27 后) Kimi K3 最强开源权重

可引用硬核数据:

  • 参数量:2.8T 总参数,896 专家 MoE,每次激活 16 个(稀疏度 1.8%)
  • KDA 效率:KV 缓存内存 -75%,百万 token 解码 +6.3×
  • AttnRes:训练效率 +25%,额外算力 <2%
  • 相对 K2:扩展效率 +2.5×
  • Intelligence Index v4.1:K3 得分 57.1,全球第四
  • ARR / 估值:2026 年 6 月 ARR 超 $300M,投前估值 $31.5B
  • 关键日期:7 月 17–20 日 WAIC → 7 月 27 日 Hugging Face 完整权重

官方与第三方参考来源(发版后请再次打开链接核对):

Moonshot AI — Kimi K3 官方技术博客

Kimi API Platform — 定价与 Quickstart 文档

Artificial Analysis — Intelligence Index v4.1 排行

Kimi K3 在架构与基准上证明国产开源模型可以正面挑战闭源旗舰,但云端 LLM 无法替代 Xcode 编译、Metal 着色器调试与 iOS 证书链;虚拟化 macOS 则伴随 EULA 风险与 20–40% 性能损耗。典型高效组合是:K3 API 负责长上下文代码推理与文档分析,VPSNIX M4/M4 Pro 物理节点负责原生编译与 AI Agent 7×24 部署——100% 原装硬件、完整 Root 权限、无 Hypervisor 损耗、按天弹性下单。报价见定价页;若关注AI 硬件与诉讼动态,更应把算力锁定在合规物理环境而非赌未决商业叙事。

SECTION 07 常见问题 FAQ

Kimi K3 可以免费使用吗?

可以——kimi.com 免费账号即可体验 K3(当前仅 max 推理力度)。API 按 token 计费,标准价 $3/$15 每百万 token。

能否在本地运行 Kimi K3?

7 月 27 日前不行;权重开放后生产级推理需 64 张以上加速卡超节点,不适合笔记本部署。

K3 与 DeepSeek V4 Pro 怎么选?

K3 参数近 2 倍(2.8T vs 1.6T)、上下文 1M vs 128K、多项基准更强;DeepSeek 输出仅 $3.48/M,成本显著更低。

100 万 token 上下文实际有用吗?

对整库代码分析、长篇法律/科研文档、多轮 Agent 长记忆尤其有价值;且 K3 不按长度加价,鼓励真正用满窗口。