7 月 27 日晚 23 點前後,月之暗面(Moonshot AI)在 Hugging Face 釋出 Kimi K3 完整模型權重與技術報告,並同步開源三項支撐訓練的核心基礎設施:MoonEP、FlashKDA、AgentEnv。K3 為 2.8 兆總參數的混合專家(MoE)架構,單次推論約啟用 1,040 億參數,支援 100 萬 token 上下文與原生視覺理解——這是全球首個被完整開放的 3 兆級模型。本文面向 AI 開發者、ML 工程師與須評估授權合規的技術決策者,梳理從 API 首發到權重釋出僅 11 天的時間軸、KDA/AttnRes 架構改動、基準對照、兩道商用授權門檻,以及自架硬體的真實門檻。結論先行:K3 是開放權重陣營的能力天花板,但嚴格而言屬 open weight 而非 OSI 意義下的 open source;對絕大多數團隊,官方 API 或 OpenRouter 呼叫遠比 64 卡自架務實。
SECTION 01 釐清 Kimi K3 開放權重:五個常見誤判
- 「開源」≠ OSI 開源:月之暗面官方材料從未使用 open source,一直以 open weight(開放權重)表述——僅公開權重、技術報告與部分 Infra,訓練資料與完整訓練程式碼未釋出。
- 授權兩道商用門檻:K3 不再標榜 Modified MIT,改採自訂授權——Model-as-a-Service 年收入超過 2,000 萬美元,或月活超過 1 億/月收入超過 2,000 萬美元,須履行額外條款。
- 自架幾乎不現實:2.8T 參數、896 個專家、1.56 TB 權重體積,官方建議 64 卡以上超節點;消費級硬體與多數企業伺服器無法承載。
- 性價比並非最優:Artificial Analysis 每任務成本約 $0.95,比 Claude Fable 5 便宜約 60%,但高於同為開放權重的 GLM-5.2(約 $0.47/任務)——7 月 22 日開源預告時的預期須以釋出日數據重新核對。
- 地緣變數:7 月 22–23 日美方蒸餾指控與 7 月 28 日商務部回應,使本次權重釋出不僅是技術事件,也是立場表態。
SECTION 02 API 首發到權重釋出:11 天時間軸與核心規格
這次開放權重距 Kimi K3 在 kimi.com 與 API 端首發,僅隔 11 天。關鍵節點如下:
- 7 月 16 日夜(WAIC 2026 前夜):K3 於 kimi.com、Kimi Work、Kimi Code 及 Kimi API 首發,僅限線上呼叫,權重尚未公開。
- 7 月 17 日:業界密集分析架構,新華社報導稱其為「目前全球參數最大的開源模型」。
- 7 月 22–23 日:中美「模型蒸餾」爭議升溫,美方指控月之暗面對 Anthropic Fable 模型進行工業化蒸餾。
- 7 月 27 日晚 23 點:正式釋出完整權重、技術報告,並開源 MoonEP、AgentEnv(FlashKDA 此前已開源)。
- 7 月 28 日:中國商務部公開回應;國內媒體跟進報導開源細節;三天後阿里巴巴發布 24 兆參數的 Qwen3.8-Max-Preview。
| 項目 | 規格 |
|---|---|
| 總參數量 | 2.8 兆(2.8T) |
| 啟用參數量 | 約 1,040 億 |
| 架構類型 | 混合專家模型(MoE) |
| 專家配置 | 896 個路由專家,每 token 啟用 16 個(另有共享專家) |
| 注意力機制 | Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA) |
| 上下文視窗 | 100 萬 token |
| 多模態能力 | 原生視覺理解(ViT-V2,27 層) |
| 權重格式 | MXFP4 權重 + MXFP8 啟用(SFT 階段起量化感知訓練) |
| 權重體積 | 約 1.56 TB(Hugging Face) |
| License | 自訂授權(官方稱 open weight,非 open source) |
SECTION 03 三大架構革新與同步開源的 Infra 工具
Kimi K3 在架構上重構深度學習沿用多年的三大傳統元件——注意力機制、殘差連接、最佳化器,這也是它與「單純堆參數」模型的關鍵差異。
- Kimi Delta Attention(KDA):將 Gated DeltaNet 的標量級遺忘門改為逐通道級別,每個特徵維度擁有獨立衰減率;採 chunkwise DPLR 公式實現線性時間遞迴,與少量 Gated MLA 層交替混合,支撐 100 萬 token 上下文同時壓低 KV Cache 開銷。
- Attention Residuals(AttnRes):殘差連接從均勻累加改為選擇性、依輸入動態聚合前面所有層輸出;每層僅新增一個 RMSNorm 與一個偽查詢向量,帶來約 25% 訓練效率提升,代價不到 2%。
- Per-Head Muon:在 Muon 最佳化器基礎上做逐注意力頭獨立最佳化,讓每個頭擁有更自適應的收斂路徑——純訓練期技術,API 使用者無感知。
- Stable LatentMoE:896 選 16 的稀疏路由(稀疏度約 1.8%),配合 Quantile Balancing 均衡策略與 MoonEP 通訊函式庫,從數學上證明每個運算節點冗餘專家數的理論上界。
| 技術 | 定位 | 關鍵能力 |
|---|---|---|
| MoonEP | 超大規模細粒度 MoE 高效能通訊函式庫 | 暫時複製過載專家,保證每節點均等 token 數;證明冗餘專家數理論上界 |
| FlashKDA | 基於 CUTLASS 的 KDA 高效能算子(此前已開源) | H20 上 prefill 比 flash-linear-attention 基線快 1.72–2.22 倍;可作 chunk_kda 直接替代後端 |
| AgentEnv | 與 KVCache.ai 聯合開發的 Agent 沙箱(Firecracker microVM) | 大規模並行 Agent RL 訓練;checkpoint 延遲低至 133 ms、恢復 49 ms、記憶體超分最高 6.5 倍(尚未第三方獨立複現) |
| 模型 | 分數 | 發布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指數(max 推理檔):Claude Fable 5 為 60,GPT-5.6 Sol 為 59,Kimi K3 約 57(全球第 3、開放權重模型第 1),GLM-5.2 為 51。K3 目前在 Arena.ai 的 Frontend Code Arena 榜單排名第一。
Kimi K3 是 3T 級開放權重模型中綜合能力最強者,但成本上並非最優——它是開放權重陣營的能力天花板,而非性價比最高的選項。
SECTION 04 Kimi K3 API 接入與授權合規六步實作
- 審閱自訂授權:確認業務是否觸及 Model-as-a-Service 年收入 2,000 萬美元門檻,或月活 1 億/月收入 2,000 萬美元的揭露義務;若計畫與月之暗面直接競爭 API 服務,須由法務重點評估第一道門檻。
- 註冊 Moonshot API:在 Moonshot 開放平台取得 API Key,模型 ID 為
kimi-k3,端點為https://api.moonshot.ai/v1。 - 設定 OpenAI SDK 相容用戶端:將
base_url指向 Moonshot 端點,api_key替換為你的金鑰,其餘 Chat Completions 呼叫邏輯通常無須改動。 - 啟用 Prompt Caching 降低成本:典型程式設計類工作負載在 Mooncake 分離式推理架構下快取命中率可達 90% 以上,實際輸入成本更接近 $0.30/M(快取命中)而非 $3.00/M 牌價。
- 評估 OpenRouter 等第三方路由:若需多模型 Fallback 或統一帳單,可透過 OpenRouter 呼叫已託管的 K3(目前已有 7 家服務商上線,定價大多與官方一致)。
- 自架可行性評估:若團隊擁有 64 卡以上超節點,可從 Hugging Face 拉取約 1.56 TB 權重;否則放棄自架,專注 API 整合與 Agent 編排層最佳化。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(response.choices[0].message.content)
SECTION 05 API 定價、硬核數據與可引用來源
| Token 類型 | 價格 |
|---|---|
| 輸入(快取命中) | $0.30 |
| 輸入(快取未命中) | $3.00 |
| 輸出(含推理過程) | $15.00 |
- 權重體積:Hugging Face 上線約 1.56 TB,釋出半小時內登頂趨勢榜第一。
- 稀疏度:896 個專家中每 token 僅啟用 16 個,稀疏度約 1.8%。
- FlashKDA 加速:NVIDIA H20 上 prefill 速度提升 1.72–2.22 倍,可作 flash-linear-attention 函式庫中 chunk_kda 的直接替代後端。
- 成本定位:每任務約 $0.95(AA Index),比 Claude Fable 5(約 $2.4/任務)便宜約 60%,但高於 GLM-5.2(約 $0.47/任務)。
- 競爭格局:三天後阿里巴巴發布 24 兆參數 Qwen3.8-Max-Preview,國產大模型競爭正式進入「3T 俱樂部」階段。
以下連結為本文事實依據,發版後請再次開啟核對最新數據:
Hugging Face moonshotai 組織(K3 權重下載)
GitHub moonshotai/FlashKDA(KDA 高效能算子)
Artificial Analysis Intelligence Index
典型高效組合是:Moonshot API 或 OpenRouter 負責 K3 百萬上下文推理,VPSNIX M4/M4 Pro 實體節點負責 Agent 編排、Xcode 編譯鏈與 iOS CI/CD 7×24 部署——雲端 LLM 再強也無法在 Hypervisor 虛擬 macOS 上穩定跑憑證鏈與 Metal 除錯;自架 K3 需要 64 卡超節點,而跑 macOS Agent 需要的是零虛擬化損耗的 Apple 原裝硬體。對於需要零損耗原生算力、穩定 iOS CI/CD 與 AI Agent 自動化的生產環境,VPSNIX 的雲端實體節點通常是更優解:100% Apple 原裝實體機、開放完整 Root 權限、無 Hypervisor 損耗、按天/週/月彈性下單。報價見定價頁。
SECTION 06 常見問題 FAQ
Kimi K3 算開源模型嗎?
嚴格來說不算。它屬「開放權重(open weight)」模型:訓練完成的權重檔、技術報告與部分 Infra 工具可公開取得,但訓練資料與完整訓練程式碼未釋出,不符合 OSI 標準下的「開源」定義。
Kimi K3 可以免費商用嗎?
可以,絕大多數商業情境不受限制。但若你營運「模型即服務」且年收入超過 2,000 萬美元,或產品月活超過 1 億/月收入超過 2,000 萬美元,須額外遵守授權條文中的特定義務。
自架 Kimi K3 需要幾張加速卡?
官方建議部署在 64 卡以上的超節點叢集,個人與多數企業使用者較務實的做法是透過官方 API 或 OpenRouter 等第三方平台呼叫。
Kimi K3 效能到底如何?
在開放權重陣營中綜合能力最強,Artificial Analysis 智能指數全球第 3,僅次 Claude Fable 5 與 GPT-5.6 Sol;但成本高於同為開放權重的 GLM-5.2,屬「開放權重陣營天花板最高、但非性價比最優」的選項。
Kimi K3 與 Kimi K2 有何差異?
K3 參數規模約為 K2.5 的三倍,架構新增 Attention Residuals 與 Per-Head Muon,上下文視窗與多模態能力大幅躍升;授權方面 K3 增設 Model-as-a-Service 收入門檻,商用限制比 K2 系列更細緻。