如果你在等 Kimi K3 开源权重、纠结要不要从 Claude/GPT 切 API,或想算清楚本地部署到底要多少卡——这篇把调研文档里的关键结论一次讲透。月之暗面 7 月 16 日已上线 K3 API 与 Kimi 全家桶,7 月 27 日将公开完整 2.8 万亿参数权重(Modified MIT)并同步技术报告。 核心判断:K3 不是「Fable 5 杀手」——AA Intelligence Index 57.1 排第三,落后 Fable 5(59.9)和 GPT-5.6 Sol(58.9)——但以约 1/3 成本做到接近前沿的能力,且给出闭源给不了的两样东西:可下载权重 + 100 万 token 上下文。
SECTION 01 选 K3 前最容易踩的五个坑
- 两个日期别混:7 月 16 日是 API/产品上线,7 月 27 日才是 Hugging Face 权重下载。搜「K3 发布」和「K3 下载」是两拨人、两个峰值。
- 「开源」要拆词:英文圈严格区分 open weights(只放权重)和 open source(含训练代码/数据)。K3 属于前者,标题写错会被社区当成外行。
- 本地部署别被标题党骗:4-bit 权重约 1.4 TB,官方建议 64+ 加速器超节点——不是单卡能跑的事。
- 跑分要看场景:K3 在长程编码、前端 UI 代码盲测上领先,GDPval、DeepSWE 等长程判断力仍输给 Fable 5。
- 幻觉率比 K2.6 上升:官方已承认;Reddit 也有接入自建应用后幻觉多于顶级闭源模型的反馈——生产环境要做抽检。
SECTION 02 时间线与模型规格一览
| 日期 | 事件 |
|---|---|
| 2026-07-16 | K3 通过 API / Kimi App / Kimi Work / Kimi Code 上线;Artificial Analysis 同日发布独立评测 |
| 2026-07-17 | 上海 WAIC 开幕;新华社将 K3 定调为国家级 AI 里程碑 |
| 2026-07-27 | Hugging Face 公开完整 2.8T 权重(Modified MIT)+ 技术报告 |
| 项目 | 数据 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T),史上最大开源权重模型 |
| 架构 | 稀疏 MoE:Stable LatentMoE,896 专家 / token 激活 16 个 |
| 注意力 | Kimi Delta Attention(KDA)+ AttnRes + Gated MLA |
| 上下文 | 1,048,576 tokens(约 100 万) |
| 模态 | 原生视觉(文本+图像);产品端支持视频理解;输出为文本 |
| 权重格式 | MXFP4 权重 + MXFP8 激活(原生低精度训练) |
| 扩展效率 | 官方称较 K2 提升约 2.5 倍(同等算力换更多智能) |
| 训练稳定性 | Quantile Balancing、Per-Head Muon、SiTU 激活函数 |
| 长上下文解码 | KDA 在百万 token 下最高 6.3 倍解码加速 |
SECTION 03 Kimi K3 跑分:领先项与短板(对标 Claude / GPT)
| 模型 | 分数 | 排名 |
|---|---|---|
| Claude Fable 5 | 59.9 | 1 |
| GPT-5.6 Sol | 58.9 | 2 |
| Kimi K3 | 57.1 | 第 3 / 189 |
领先或打平:Frontend Code Arena 第 1(盲测 UI 代码偏好超 Fable/Sol);Automation Bench、SpreadsheetBench 2 第 1;BrowseComp 91.2(第 1);SWE Marathon 42.0(超长编码会话明显领先,GPT-5.5/GLM-5.2 崩到十几分);Terminal Bench 2.1 88.3(与 Sol 88.8 基本打平);Program Bench 77.8;FrontierSWE 81.2(超 Sol 71.3,低于 Fable 5 86.6)。
仍落后:GDPval v2 Elo 1668–1687 vs Fable 5 1760、Sol 1748;DeepSWE 67.5 vs Sol 73.0;对话打磨度与单次会话方差逊于 Fable 5 / Sol。
月之暗面发布时罕见地主动承认综合性能仍落后 Fable 5 和 GPT-5.6 Sol,并列出短板:对 harness 传回推理内容敏感、意图模糊时过于主动等。架构细节可参考Kimi K3 深度评测;开源圈另一强选手见DeepSeek V4 满血版解析。
SECTION 04 Kimi K3 API 价格与真实成本(含缓存)
| 项目 | 价格 |
|---|---|
| 输入(缓存未命中) | $3.00 |
| 输入(缓存命中,自动缓存) | $0.30 |
| 输出 | $15.00 |
定价对齐西方「质量牌」,是中国厂商里最高的,但仍显著低于 Claude Opus 4.8 单任务成本。AA 实测单任务 $0.94:比 GPT-5.6 Sol 低 9.4%,比 Claude Fable 5 低 65.8%。编码类负载缓存命中率据称超 90%,实际账单远低于表面单价。
SECTION 05 7 月 27 日开源发布:会发生什么
- 完整 2.8T 权重上架 Moonshot Hugging Face 组织,Modified MIT(条款以发布日原文为准)
- 同步技术报告:架构、训练、评估细节
- vLLM 对 KDA / prefix caching 的支持将随权重落地;后续 Ollama、GGUF 量化预计跟进(参考 K2 系列节奏)
SECTION 06 本地部署真相:显存要求与发布日核对清单
结论先说:消费级硬件跑不了。 4-bit 权重约 1.4 TB;官方建议 64+ 加速器超节点,需专家并行 + 张量并行。参照:K2.7 Code(1T)INT4 约 577 GB 显存,K3 是其 2.8 倍。
自部署只在三种场景成立:严格数据驻留/离线、自有数据微调、调用量大到自建更便宜。绝大多数人正确答案是用 API($3/$15)。
- 提前关注 HF 组织:发布日第一时间核对仓库文件是否齐全。
- 阅读 LICENSE 原文:Modified MIT 不等于标准 MIT,商用与再分发条款以文件为准。
- 确认量化版本:MXFP4 官方包与社区 GGUF/INT4 分支分别验证。
- 跟踪 vLLM / SGLang 启动命令:KDA 与 prefix caching 需匹配版本,生产前 pin commit。
- 对照技术报告最低硬件:加速器数量、互联、并行策略与预算对齐。
- 独立长上下文复测:百万 token 解码加速勿只信官方数字,用自己的 harness 跑一遍。
- 算 API vs 自建 TCO:含电力、运维、网络与编码 Agent 缓存命中率。
SECTION 07 行业意义:开源追平闭源、地缘与月之暗面翻身
- 能力差距基本闭合:综合分从「差几百」缩到「差两三分」,闭源很难再纯靠能力证明溢价。
- 地缘背景:发布赶在 WAIC;一个月前美国曾短暂下架 Anthropic Fable/Mythos(7 月 1 日恢复)——「监管能关闭源,关不掉已发布的开源权重」成为新叙事。
- 中国厂商集体逼近:Z.ai GLM-5.2、DeepSeek V4 Pro(1.6T)、MiniMax 等,K3 是这波浪潮的高点。
- 月之暗面翻身:2025 年初被 DeepSeek R1 冲击后国内排名跌至第七,靠 K2 → K2.5 → K3 开源路线重建地位。
SECTION 08 可引用数据与权威来源
- 参数:2.8T;896 专家激活 16 个;上下文 1,048,576
- AA Index:K3 57.1 / Sol 58.9 / Fable 5 59.9
- 单任务成本:K3 $0.94,比 Fable 5 低 65.8%
- API:$3 / $0.30(缓存)/ $15 每百万 tokens
- 自部署:4-bit 约 1.4 TB;建议 64+ 加速器
- 编码亮点:Frontend Code Arena 第 1;SWE Marathon 42.0
以下链接请在发版或上游更新后再次打开核对:
Artificial Analysis 独立评测(2026-07-16)
K3 开源权重会改写「前沿能力」的定价逻辑,但不能替代 Xcode 编译、Metal 调试和 iOS 签名链。虚拟机 macOS 有 EULA 风险且性能损耗 20–40%。务实组合是:K3 API(或未来自建推理)负责百万上下文推理与 Agent 编排,VPSNIX M4/M4 Pro 云端物理节点负责原生 Apple Silicon 构建——100% 苹果原装、完整 Root、零 Hypervisor 损耗、按天/月弹性下单。详见定价页;若已读过K3 评测,下一步应把算力锚定在合规物理基础设施上,而不是赌单一 API 厂商的涨价曲线。
SECTION 09 常见问题 FAQ
K3 权重什么时候能下载?
2026 年 7 月 27 日。API 与产品已于 7 月 16 日上线;完整 checkpoint 与技术报告在 27 日通过 Hugging Face 发布。
K3 免费吗?
权重下载在 Modified MIT 下免费获取(以 LICENSE 为准);API 按量计费:输入 $3/$0.30(缓存)、输出 $15 每百万 tokens。
K3 能本地跑吗?
需要数据中心级集群,4-bit 约 1.4 TB,官方建议 64+ 加速器。个人开发者请直接用 API。
K3 和 DeepSeek 哪个强?
看场景:K3 综合 Index 第三、长程编码与前端代码盲测强;DeepSeek V4 Pro 1.6T 峰谷计费更便宜。两者都是 2026 开源梯队顶流,建议按工作负载 A/B。
K3 比 Claude/GPT 强吗?
综合智能仍排第三,未超越 Fable 5 和 GPT-5.6 Sol;特定编码/自动化基准领先,单任务成本低约 65.8%。
用什么协议开源?
Modified MIT,完整条文以 7 月 27 日 Hugging Face 仓库 LICENSE 文件为准。