若你正在等 Kimi K3 開源權重、評估是否從 Claude/GPT API 遷移,或想算清 MoE 2.8 萬億參數自架到底要幾張卡——本文把調研結論一次整理給 AI 工程師與技術決策者。 月之暗面已於 7 月 16 日上線 K3 API 與 Kimi 全系列產品;7 月 27 日將在 Hugging Face 以 Modified MIT 公開完整 2.8T 權重與技術報告(上下文 1,048,576 token)。 結論先行:K3 並非「Fable 5 殺手」——Artificial Analysis Intelligence Index 57.1 排第三,落後 Claude Fable 5(59.9)與 GPT-5.6 Sol(58.9)——但以約三分之一任務成本提供接近前沿的能力,並給出閉源 API 無法在你自有伺服器上複製的兩項:可下載權重 + 百萬 token 長上下文。
SECTION 01 為什麼 Kimi K3 open weights 連資深 ML 工程師也會搞混
- 兩個日期、同一模型:7 月 16 日是 API/Kimi App/Kimi Work/Kimi Code;7 月 27 日才是權重檔與技術報告。搜尋意圖不同,混寫會失去 Featured Snippet 資格。
- open weights 不等於 open source:英文社群嚴格區分「可下載 checkpoint」與「含訓練程式碼與資料」。K3 屬前者;標題寫錯會在 Hacker News 被視為外行。
- 自架標題常省略硬體現實:4-bit 權重約 1.4 TB 儲存;官方建議 64 張以上加速卡超節點,需 expert + tensor 並行——筆電無法跑 K3。
- 基準對 harness 敏感:Moonshot 承認 K3 對「回傳 reasoning 內容」的評測框架反應強,且在模糊意圖上可能過度主動——跨廠商分數須標註跑分日期與限制。
- 閉源仍在對話 polish 領先:GDPval v2 Elo、DeepSWE 等長程判斷仍偏 Fable 5 與 Sol;K3 在持續編碼與自動化基準領先——依工作負載選型,勿跟風標題。
SECTION 02 Kimi K3 釋出時程與完整規格表
| 日期 | 事件 |
|---|---|
| 2026-07-16 | K3 透過 API、Kimi App、Kimi Work、Kimi Code 上線;Artificial Analysis 同日發布獨立評測 |
| 2026-07-17 | 上海 WAIC 開幕;新華社將 K3 定位為國家級 AI 里程碑 |
| 2026-07-27 | Hugging Face 完整 2.8T 權重(Modified MIT)+ 技術報告(架構、訓練、評測) |
| 項目 | 細節 |
|---|---|
| 總參數量 | 2.8 萬億(2.8T)——迄今最大 open-weight 模型 |
| 架構 | Sparse MoE — Stable LatentMoE;896 experts,每 token 啟用 16 個 |
| Attention | Kimi Delta Attention(KDA,hybrid linear)+ Attention Residuals(AttnRes)+ Gated MLA |
| 上下文視窗 | 1,048,576 token(約 100 萬) |
| 模態 | 原生視覺(文字 + 影像);產品層級含影片理解;輸出為文字 |
| 權重格式 | MXFP4 weights + MXFP8 activations(原生低精度訓練) |
| Scaling 效率 | 相同算力下約 2.5× vs K2(官方宣稱) |
| 訓練穩定性 | Quantile Balancing(expert routing)、Per-Head Muon optimizer、SiTU activation |
| 長上下文解碼 | KDA 在 100 萬 token 上下文可達最高 6.3× decode 加速 |
K3 定位為首個約 3T 級 open-weight 模型——直接挑戰閉源 API 的價格溢價,而非宣稱在每項 frontier 基準上全面取代 closed 旗艦。
SECTION 03 Kimi K3 基準 vs Claude Fable 5 與 GPT-5.6 Sol
Artificial Analysis Intelligence Index(2026 年 7 月 16 日跑分):
| 模型 | 分數 | 排名 |
|---|---|---|
| Claude Fable 5 | 59.9 | 1 |
| GPT-5.6 Sol | 58.9 | 2 |
| Kimi K3 | 57.1 | 3 / 189 |
K3 領先或持平:Frontend Code Arena 第 1(UI 程式碼盲測開發者偏好勝 Fable 5 與 Sol);Automation Bench 與 SpreadsheetBench 2 第 1;BrowseComp 91.2(第 1,1M 無壓縮策略可達 90.4+);SWE Marathon 42.0(長時編碼——GPT-5.5 與 GLM-5.2 跌至 teens);Terminal Bench 2.1 88.3(接近 Sol 88.8);Program Bench 77.8;FrontierSWE 81.2(高於 Sol 71.3,低於 Fable 5 86.6)。
K3 仍落後:GDPval v2 Elo 1668–1687 vs Fable 5 1760 與 Sol 1748;DeepSWE 67.5 vs Sol 73.0;幻覺率較 K2.6 上升(官方承認);Reddit 回報自架應用中幻覺多於頂級閉源;對話 polish 與單次 session 變異仍落後 Fable 5 與 Sol。
架構深度可見Kimi K3 開源大模型深度評測;同波 open-weight 競品可對照DeepSeek V4 滿血版 GA 發布分析。
SECTION 04 Kimi K3 API 定價與快取後真實成本
| 項目 | 價格 |
|---|---|
| Input(cache miss) | $3.00 |
| Input(cache hit,自動) | $0.30 |
| Output | $15.00 |
定價居中國 LLM 廠商最高檔,仍遠低於 Claude Opus 4.8 單任務成本。Artificial Analysis 測得 K3 每任務 $0.94:比 GPT-5.6 Sol 低 9.4%,比 Claude Fable 5 低 65.8%。編碼工作負載快取命中率可逾 90%,實際支出常低於牌價。
SECTION 05 Kimi K3 算 open source 嗎?open weights 與 open source 的差別
7 月 27 日 Moonshot 將在 Hugging Face 組織下發布完整 2.8T 權重,授權為 Modified MIT(完整條文以釋出日為準)。技術報告涵蓋架構、訓練與評測。預期 vLLM 將同步支援 KDA 與 prefix caching;Ollama、GGUF 量化通常跟進 K2 系列節奏。
用語精準:K3 屬 open-weight 釋出——可下載並在授權範圍內執行 checkpoint。並非完整 open source(公開訓練程式碼與資料集)。合規與 SEO 查詢如 is kimi k3 open source 須在正文說清。
SECTION 06 能否本地跑 Kimi K3?硬體需求與釋出日檢查清單
誠實答案:消費級硬體不行。4-bit 量化權重約占 1.4 TB。官方指引指向 super-node:64 張以上加速卡,expert parallelism 加 tensor parallelism。參考:K2.7 Code 1T 參數 INT4 約需 577 GB VRAM——K3 參數量為 2.8 倍。
自架僅在三種情境合理:嚴格資料落地或離線、以專有資料 fine-tune、或呼叫量高到自有硬體 TCO 低於 API。其餘預設走 API($3/$15 每百萬 token)。
- 7 月 27 日前 Watch Moonshot AI Hugging Face 組織——repo 一上線即收到通知。
- 釋出日完整閱讀 LICENSE——Modified MIT 勿假設等同標準 MIT。
- 確認權重分片與量化格式——MXFP4 套件及社群 INT4/GGUF 版本。
- 追蹤 vLLM release notes——KDA 與 prefix caching 上線後再 pin 相容 commit。
- 對照技術報告最低硬體——加速卡數量、互連、並行策略 vs 叢集預算。
- 獨立重跑長上下文測試——驗證 100 萬 token decode 宣稱,勿只信簡報。
- 比較 API 與自架 TCO——含電力、網路頻寬、維運人力與編碼 agent 快取假設。
SECTION 07 7 月 27 日權重釋出對產業的意義
- open 與 closed 能力差距逼近個位數——Intelligence Index 僅差數分,閉源廠商難再以「更聰明」單獨 justify 溢價。
- 地緣背景:K3 趕在 WAIC 2026 前;一個月前美國曾短暫 delist Anthropic Fable/Mythos(7 月 1 日恢復)。權重一旦公開,監管無法「下架」——open-weight 倡議的新論點。
- 中國廠商浪潮:Z.ai GLM-5.2、DeepSeek V4 Pro(1.6T)、MiniMax 等——K3 為本輪峰值。
- Moonshot 逆襲:DeepSeek R1 震盪 2025 年初排名(Moonshot 一度跌至國內第七)後,K2 → K2.5 → K3 open-weight 路線重建可信度。
SECTION 08 可引用技術數據與權威來源
- 參數:2.8T;896 MoE experts,每 token 16 active
- 上下文:1,048,576 token
- Intelligence Index:K3 57.1 / Sol 58.9 / Fable 5 59.9(AA,2026.07.16)
- 每任務成本:K3 $0.94——比 Fable 5 低 65.8%
- API:$3 input miss / $0.30 cache hit / $15 output 每 M token
- 自架儲存:4-bit 約 1.4 TB;建議 64+ 加速卡
- 授權:Modified MIT(7 月 27 日確認全文)
- 編碼亮點:Frontend Code Arena 第 1;SWE Marathon 42.0
官方與獨立參考——上游更新後請再次核對連結:
Artificial Analysis — Intelligence Index 與成本基準(2026.07.16)
K3 open weights 改變 near-frontier AI 的經濟帳,但無法編譯 Xcode 專案、簽署 iOS 二進位或除錯 Metal shader。虛擬化 macOS 堆疊帶 EULA 風險與可測 Hypervisor 損耗。實務生產模式:以 K3 API(或未來自架 endpoint)處理百萬 token 推理與 agent 編排,並以 VPSNIX M4/M4 Pro 實體節點跑原生 Apple Silicon 建置——100% Apple 硬體、完整 Root 權限、零虛擬化稅、按日/月彈性計費。查閱定價,將長時 agent 錨定在合規實體基礎設施,而非單一 vendor API 曲線。
SECTION 09 常見問題 FAQ
Kimi K3 權重何時釋出?
2026 年 7 月 27 日。API 與 Kimi 應用於 7 月 16 日上線;可下載 checkpoint 與技術報告於 27 日透過 Hugging Face 以 Modified MIT 發布。
Kimi K3 真的是 open source 嗎?
屬 open-weight 釋出——取得授權模型 checkpoint。訓練程式碼與資料集不在 7 月 27 日套件內。標題用 open weights,正文說明細節。
Kimi K3 費用多少?
API 牌價:$3/M input(cache miss)、$0.30/M input(cache hit)、$15/M output。Artificial Analysis 代表性任務約 $0.94——比 Claude Fable 5 低 65.8%。
能在消費級 GPU 上跑 Kimi K3 嗎?
不能。4-bit 約 1.4 TB,官方建議 64+ 加速卡分散式 super-node。除非營運資料中心級硬體,否則請用 API。
Kimi K3 比 Claude Fable 5 或 GPT-5.6 Sol 更好嗎?
綜合 Intelligence Index:否——K3 57.1,Fable 5 59.9,Sol 58.9。特定編碼與自動化基準領先且每任務成本低很多。依工作負載選型,勿只看單一 headline 分數。
Kimi K3 使用什麼授權?
Modified MIT;完整條文於 7 月 27 日 Hugging Face 釋出。商業再散布或 fine-tune 再散布前請讀實際 LICENSE 檔。