首页 / 博客 / Kimi K3开源
ENGINEERING_BLOG · 2026.07.28

Kimi K3 全面开源:2.8万亿参数、百万上下文,月之暗面这次放了什么大招

KIMI K3 · 总参数量
2.8T

全球首个完整开放的 3 万亿参数级别模型,Hugging Face 权重约 1.56TB。

7 月 27 日晚 23 点左右,月之暗面(Moonshot AI)正式发布 Kimi K3 的完整模型权重与技术报告,并同步开源支撑其训练的三项核心基础设施技术:MoonEP、FlashKDA、AgentEnv。K3 是一个拥有 2.8 万亿总参数的混合专家(MoE)模型,激活参数约 1040 亿,支持 100 万 token 上下文窗口,具备原生视觉理解能力——这是全球首个被完整开放的 3 万亿参数级别模型。本文面向 AI 开发者、ML 工程师与评估许可证合规的技术决策者,拆解从 API 首发到全面开源仅 11 天的时间线、KDA/AttnRes 架构创新、基准对比、两道商业许可门槛,以及自部署硬件真相。结论先行:K3 是开源阵营能力天花板最高的选项,但严格来说是「开放权重」而非 OSI 意义下的「开源」;对绝大多数团队,官方 API 或 OpenRouter 调用远比 64 卡自托管现实。

SECTION 01 Kimi K3 全面开源前,你需要警惕哪些误区?

  • 「开源」≠ OSI 开源:月之暗面官方材料从未使用「open source」,一直采用「open weight(开放权重)」表述——只公开权重、技术报告与部分 Infra,训练数据与完整训练代码未公开。
  • 许可证两道商业门槛:K3 不再自称「Modified MIT」,而是自定义许可证——Model-as-a-Service 年收入超 2000 万美元、或月活超 1 亿/月收入超 2000 万美元,须满足额外条款。
  • 自部署几乎不现实:2.8T 参数、896 个专家、1.56TB 权重体积,官方建议 64 卡及以上超节点;消费级与大部分企业硬件无法承载。
  • 性价比并非最优:Artificial Analysis 每任务成本约 $0.95,比 Claude Fable 5 便宜约 60%,但比同为开源的 GLM-5.2(约 $0.47/任务)更贵——7 月 22 日开源预告时的预期需用发布日数据重新核对。
  • 地缘政治变量:7 月 22–23 日美方蒸馏指控与 7 月 28 日商务部回应,使本次权重发布不仅是技术事件,也是态度表达。

SECTION 02 从 API 首发到全面开源:11 天时间线与核心参数

这次开源距离 Kimi K3 在 kimi.com 和 API 端首发,只过去了 11 天。关键节点如下:

  • 7 月 16 日夜(WAIC 2026 前夜):K3 在 kimi.com、Kimi Work、Kimi Code 以及 Kimi API 首发,仅限在线调用,权重尚未公开。
  • 7 月 17 日:行业密集分析架构,新华社报道称其为「目前全球参数最大的开源模型」。
  • 7 月 22–23 日:中美「模型蒸馏」争端升级,美方指控月之暗面对 Anthropic Fable 模型进行工业化蒸馏。
  • 7 月 27 日晚 23 点:正式发布完整权重、技术报告,并开源 MoonEP、AgentEnv(FlashKDA 此前已开源)。
  • 7 月 28 日:中国商务部公开回应;国内媒体跟进报道开源细节;三天后阿里巴巴发布 24 万亿参数的 Qwen3.8-Max-Preview。
Kimi K3 核心参数一览
项目 参数
总参数量 2.8 万亿(2.8T)
激活参数量 约 1040 亿
架构类型 混合专家模型(MoE)
专家配置 896 个路由专家,每 token 激活 16 个(另有共享专家)
注意力机制 Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA)
上下文窗口 100 万 token
多模态能力 原生视觉理解(ViT-V2,27 层)
权重格式 MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练)
权重体积 约 1.56TB(Hugging Face)
License 自定义许可证(官方称 open weight,非 open source)

SECTION 03 三大架构创新与开源 Infra:KDA、MoonEP 与 AgentEnv

Kimi K3 在架构上重构了深度学习沿用多年的三大传统组件——注意力机制、残差连接、优化器,这也是它区别于「简单堆参数」的关键。

  • Kimi Delta Attention(KDA):将 Gated DeltaNet 的标量级遗忘门改为逐通道级别,每个特征维度拥有独立衰减率;采用 chunkwise DPLR 公式实现线性时间递归,与少量 Gated MLA 层交替混合,支撑 100 万 token 上下文同时压低 KV Cache 开销。
  • Attention Residuals(AttnRes):残差连接从均匀累加改为选择性、依据输入动态聚合前面所有层输出;每层仅新增一个 RMSNorm 和一个伪查询向量,带来约 25% 训练效率提升,代价不到 2%。
  • Per-Head Muon:在 Muon 优化器基础上做逐注意力头独立优化,让每个头拥有更自适应的收敛路径——纯训练期技术,API 调用者无感知。
  • Stable LatentMoE:896 选 16 的稀疏路由(稀疏度约 1.8%),配合 Quantile Balancing 均衡策略与 MoonEP 通信库,从数学上证明每个计算节点冗余专家数的理论上界。
三大开源 Infra 技术
技术 定位 关键能力
MoonEP 超大规模细粒度 MoE 高性能通信库 临时复制过载专家,保证每节点均等 token 数;证明冗余专家数理论上界
FlashKDA 基于 CUTLASS 的 KDA 高性能算子(此前已开源) H20 上 prefill 比 flash-linear-attention 基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端
AgentEnv 与 KVCache.ai 联合开发的 Agent 沙箱(Firecracker microVM) 大规模并行 Agent RL 训练;checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍(尚未第三方独立复现)
SWE-bench Verified 独立复测(Vals AI,截至 2026 年 7 月)
模型 分数 发布日期
Claude Opus 5 97% 2026-07-24
GPT-5.6 Sol 96.2% 2026-07-09
Claude Fable 5 95% 2026-06-09
Kimi K3 93.4% 2026-07-16
Qwen3.7-Max 79.4% 2026-05-19
DeepSeek-V4 76.2% 2026-04-23

Artificial Analysis 智能指数(max 推理档):Claude Fable 5 为 60,GPT-5.6 Sol 为 59,Kimi K3 约 57(全球第 3、开源模型第 1),GLM-5.2 为 51。K3 目前在 Arena.ai 的 Frontend Code Arena 榜单上排名第一。

Kimi K3 是开源 3T 级模型中综合能力最强的一个,但成本上并非最优——它是开源阵营里能力天花板最高的选项,而不是性价比最高的选项。

SECTION 04 Kimi K3 API 接入与许可证合规六步实操

  1. 审阅自定义许可证:确认你的业务是否触及 Model-as-a-Service 年收入 2000 万美元门槛,或月活 1 亿/月收入 2000 万美元的展示义务;若计划与月之暗面直接竞争 API 服务,须法务重点评估第一道门槛。
  2. 注册 Moonshot API:在 Moonshot 开放平台获取 API Key,模型 ID 为 kimi-k3,端点为 https://api.moonshot.ai/v1
  3. 配置 OpenAI SDK 兼容客户端:base_url 指向 Moonshot 端点,api_key 替换为你的密钥,其余 Chat Completions 调用逻辑通常无需改动。
  4. 启用 Prompt Caching 降低成本:典型编程类工作负载在 Mooncake 分离式推理架构下缓存命中率可达 90% 以上,实际输入成本更接近 $0.30/M(缓存命中)而非 $3.00/M 表头价。
  5. 评估 OpenRouter 等第三方路由:若需多模型 Fallback 或统一账单,可通过 OpenRouter 调用已托管的 K3(目前已有 7 家服务商上线,定价大多与官方一致)。
  6. 自部署可行性评估:若团队拥有 64 卡及以上超节点,可从 Hugging Face 拉取约 1.56TB 权重;否则放弃自托管,专注 API 集成与 Agent 编排层优化。
kimi_k3_api.py
# OpenAI SDK 兼容调用示例
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(response.choices[0].message.content)

SECTION 05 API 定价、硬核数据与可引用来源

Kimi K3 API 定价(每百万 token)
Token 类型 价格
输入(缓存命中) $0.30
输入(缓存未命中) $3.00
输出(含推理过程) $15.00
  • 权重体积:Hugging Face 上线约 1.56TB,发布半小时内登顶趋势榜第一。
  • 稀疏度:896 专家中每 token 仅激活 16 个,稀疏度约 1.8%。
  • FlashKDA 加速:NVIDIA H20 上 prefill 速度提升 1.72–2.22 倍,可作为 flash-linear-attention 库中 chunk_kda 的直接替代后端。
  • 成本定位:每任务约 $0.95(AA Index),比 Claude Fable 5(约 $2.4/任务)便宜约 60%,但比 GLM-5.2(约 $0.47/任务)更贵。
  • 竞争格局:三天后阿里巴巴发布 24 万亿参数 Qwen3.8-Max-Preview,国产大模型竞争正式进入「3T 俱乐部」阶段。

以下链接为本文事实依据,发版后请再次打开核对最新数据:

Moonshot AI 官方 Kimi K3 技术博客

Hugging Face moonshotai 组织(K3 权重下载)

GitHub moonshotai/FlashKDA(KDA 高性能算子)

Artificial Analysis Intelligence Index

典型高效组合是:Moonshot API 或 OpenRouter 负责 K3 百万上下文推理,VPSNIX M4/M4 Pro 物理节点负责 Agent 编排、Xcode 编译链与 iOS CI/CD 7×24 部署——云端 LLM 再强也无法在 Hypervisor 虚拟 macOS 上稳定跑证书链与 Metal 调试;自托管 K3 需要 64 卡超节点,而跑 macOS Agent 需要的是零虚拟化损耗的苹果原装硬件。对于需要零损耗原生算力、稳定 iOS CI/CD 与 AI Agent 自动化的生产环境,VPSNIX 的云端物理节点通常是更优解:100% 苹果原装物理机、开放完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。报价见定价页

SECTION 06 常见问题 FAQ

Kimi K3 真的是开源模型吗?

严格来说不是。它属于「开放权重(open weight)」模型:训练完成的权重文件、技术报告和部分 Infra 工具是公开的,但训练数据和完整训练代码没有公开,不符合 OSI 标准下的「开源」定义。

Kimi K3 可以免费商用吗?

可以,绝大多数商业场景不受限制。但如果你运营的是「模型即服务」业务且年收入超过 2000 万美元,或产品月活超过 1 亿/月收入超过 2000 万美元,需要额外满足许可证中的特定条款。

Kimi K3 需要多少显卡才能自己部署?

官方建议部署在 64 卡及以上的超节点集群,个人和大部分企业用户更现实的方式是通过官方 API 或 OpenRouter 等第三方平台调用。

Kimi K3 的性能到底强不强?

在开源模型阵营中综合能力最强,Artificial Analysis 智能指数全球第 3,仅次于 Claude Fable 5 和 GPT-5.6 Sol;但成本高于同为开源的 GLM-5.2,属于「开源阵营天花板最高、但非性价比最优」的选择。

Kimi K3 和 Kimi K2 有什么区别?

K3 参数规模是 K2.5 的约 3 倍,架构上新增了 Attention Residuals 和 Per-Head Muon,上下文窗口和多模态能力也大幅提升;许可证方面 K3 新增了 Model-as-a-Service 收入门槛,商业限制比 K2 系列更细化。