首頁 / 部落格 / K3 開放權重
ENGINEERING_BLOG · 2026.07.28

Kimi K3 完整開放權重:2.8 兆參數、百萬 token 上下文,月之暗面這次釋出了什麼?

KIMI K3 · 總參數量
2.8T

全球首個完整開放的 3 兆級模型,Hugging Face 權重約 1.56 TB。

7 月 27 日晚 23 點前後,月之暗面(Moonshot AI)在 Hugging Face 釋出 Kimi K3 完整模型權重與技術報告,並同步開源三項支撐訓練的核心基礎設施:MoonEP、FlashKDA、AgentEnv。K3 為 2.8 兆總參數的混合專家(MoE)架構,單次推論約啟用 1,040 億參數,支援 100 萬 token 上下文與原生視覺理解——這是全球首個被完整開放的 3 兆級模型。本文面向 AI 開發者、ML 工程師與須評估授權合規的技術決策者,梳理從 API 首發到權重釋出僅 11 天的時間軸、KDA/AttnRes 架構改動、基準對照、兩道商用授權門檻,以及自架硬體的真實門檻。結論先行:K3 是開放權重陣營的能力天花板,但嚴格而言屬 open weight 而非 OSI 意義下的 open source;對絕大多數團隊,官方 API 或 OpenRouter 呼叫遠比 64 卡自架務實。

SECTION 01 釐清 Kimi K3 開放權重:五個常見誤判

  • 「開源」≠ OSI 開源:月之暗面官方材料從未使用 open source,一直以 open weight(開放權重)表述——僅公開權重、技術報告與部分 Infra,訓練資料與完整訓練程式碼未釋出。
  • 授權兩道商用門檻:K3 不再標榜 Modified MIT,改採自訂授權——Model-as-a-Service 年收入超過 2,000 萬美元,或月活超過 1 億/月收入超過 2,000 萬美元,須履行額外條款。
  • 自架幾乎不現實:2.8T 參數、896 個專家、1.56 TB 權重體積,官方建議 64 卡以上超節點;消費級硬體與多數企業伺服器無法承載。
  • 性價比並非最優:Artificial Analysis 每任務成本約 $0.95,比 Claude Fable 5 便宜約 60%,但高於同為開放權重的 GLM-5.2(約 $0.47/任務)——7 月 22 日開源預告時的預期須以釋出日數據重新核對。
  • 地緣變數:7 月 22–23 日美方蒸餾指控與 7 月 28 日商務部回應,使本次權重釋出不僅是技術事件,也是立場表態。

SECTION 02 API 首發到權重釋出:11 天時間軸與核心規格

這次開放權重距 Kimi K3 在 kimi.com 與 API 端首發,僅隔 11 天。關鍵節點如下:

  • 7 月 16 日夜(WAIC 2026 前夜):K3 於 kimi.com、Kimi Work、Kimi Code 及 Kimi API 首發,僅限線上呼叫,權重尚未公開。
  • 7 月 17 日:業界密集分析架構,新華社報導稱其為「目前全球參數最大的開源模型」。
  • 7 月 22–23 日:中美「模型蒸餾」爭議升溫,美方指控月之暗面對 Anthropic Fable 模型進行工業化蒸餾。
  • 7 月 27 日晚 23 點:正式釋出完整權重、技術報告,並開源 MoonEP、AgentEnv(FlashKDA 此前已開源)。
  • 7 月 28 日:中國商務部公開回應;國內媒體跟進報導開源細節;三天後阿里巴巴發布 24 兆參數的 Qwen3.8-Max-Preview。
Kimi K3 核心規格一覽
項目 規格
總參數量 2.8 兆(2.8T)
啟用參數量 約 1,040 億
架構類型 混合專家模型(MoE)
專家配置 896 個路由專家,每 token 啟用 16 個(另有共享專家)
注意力機制 Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA)
上下文視窗 100 萬 token
多模態能力 原生視覺理解(ViT-V2,27 層)
權重格式 MXFP4 權重 + MXFP8 啟用(SFT 階段起量化感知訓練)
權重體積 約 1.56 TB(Hugging Face)
License 自訂授權(官方稱 open weight,非 open source)

SECTION 03 三大架構革新與同步開源的 Infra 工具

Kimi K3 在架構上重構深度學習沿用多年的三大傳統元件——注意力機制、殘差連接、最佳化器,這也是它與「單純堆參數」模型的關鍵差異。

  • Kimi Delta Attention(KDA):將 Gated DeltaNet 的標量級遺忘門改為逐通道級別,每個特徵維度擁有獨立衰減率;採 chunkwise DPLR 公式實現線性時間遞迴,與少量 Gated MLA 層交替混合,支撐 100 萬 token 上下文同時壓低 KV Cache 開銷。
  • Attention Residuals(AttnRes):殘差連接從均勻累加改為選擇性、依輸入動態聚合前面所有層輸出;每層僅新增一個 RMSNorm 與一個偽查詢向量,帶來約 25% 訓練效率提升,代價不到 2%。
  • Per-Head Muon:在 Muon 最佳化器基礎上做逐注意力頭獨立最佳化,讓每個頭擁有更自適應的收斂路徑——純訓練期技術,API 使用者無感知。
  • Stable LatentMoE:896 選 16 的稀疏路由(稀疏度約 1.8%),配合 Quantile Balancing 均衡策略與 MoonEP 通訊函式庫,從數學上證明每個運算節點冗餘專家數的理論上界。
三項同步開源的 Infra 技術
技術 定位 關鍵能力
MoonEP 超大規模細粒度 MoE 高效能通訊函式庫 暫時複製過載專家,保證每節點均等 token 數;證明冗餘專家數理論上界
FlashKDA 基於 CUTLASS 的 KDA 高效能算子(此前已開源) H20 上 prefill 比 flash-linear-attention 基線快 1.72–2.22 倍;可作 chunk_kda 直接替代後端
AgentEnv 與 KVCache.ai 聯合開發的 Agent 沙箱(Firecracker microVM) 大規模並行 Agent RL 訓練;checkpoint 延遲低至 133 ms、恢復 49 ms、記憶體超分最高 6.5 倍(尚未第三方獨立複現)
SWE-bench Verified 獨立複測(Vals AI,截至 2026 年 7 月)
模型 分數 發布日期
Claude Opus 5 97% 2026-07-24
GPT-5.6 Sol 96.2% 2026-07-09
Claude Fable 5 95% 2026-06-09
Kimi K3 93.4% 2026-07-16
Qwen3.7-Max 79.4% 2026-05-19
DeepSeek-V4 76.2% 2026-04-23

Artificial Analysis 智能指數(max 推理檔):Claude Fable 5 為 60,GPT-5.6 Sol 為 59,Kimi K3 約 57(全球第 3、開放權重模型第 1),GLM-5.2 為 51。K3 目前在 Arena.ai 的 Frontend Code Arena 榜單排名第一。

Kimi K3 是 3T 級開放權重模型中綜合能力最強者,但成本上並非最優——它是開放權重陣營的能力天花板,而非性價比最高的選項。

SECTION 04 Kimi K3 API 接入與授權合規六步實作

  1. 審閱自訂授權:確認業務是否觸及 Model-as-a-Service 年收入 2,000 萬美元門檻,或月活 1 億/月收入 2,000 萬美元的揭露義務;若計畫與月之暗面直接競爭 API 服務,須由法務重點評估第一道門檻。
  2. 註冊 Moonshot API:在 Moonshot 開放平台取得 API Key,模型 ID 為 kimi-k3,端點為 https://api.moonshot.ai/v1
  3. 設定 OpenAI SDK 相容用戶端:base_url 指向 Moonshot 端點,api_key 替換為你的金鑰,其餘 Chat Completions 呼叫邏輯通常無須改動。
  4. 啟用 Prompt Caching 降低成本:典型程式設計類工作負載在 Mooncake 分離式推理架構下快取命中率可達 90% 以上,實際輸入成本更接近 $0.30/M(快取命中)而非 $3.00/M 牌價。
  5. 評估 OpenRouter 等第三方路由:若需多模型 Fallback 或統一帳單,可透過 OpenRouter 呼叫已託管的 K3(目前已有 7 家服務商上線,定價大多與官方一致)。
  6. 自架可行性評估:若團隊擁有 64 卡以上超節點,可從 Hugging Face 拉取約 1.56 TB 權重;否則放棄自架,專注 API 整合與 Agent 編排層最佳化。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(response.choices[0].message.content)

SECTION 05 API 定價、硬核數據與可引用來源

Kimi K3 API 定價(每百萬 token)
Token 類型 價格
輸入(快取命中) $0.30
輸入(快取未命中) $3.00
輸出(含推理過程) $15.00
  • 權重體積:Hugging Face 上線約 1.56 TB,釋出半小時內登頂趨勢榜第一。
  • 稀疏度:896 個專家中每 token 僅啟用 16 個,稀疏度約 1.8%。
  • FlashKDA 加速:NVIDIA H20 上 prefill 速度提升 1.72–2.22 倍,可作 flash-linear-attention 函式庫中 chunk_kda 的直接替代後端。
  • 成本定位:每任務約 $0.95(AA Index),比 Claude Fable 5(約 $2.4/任務)便宜約 60%,但高於 GLM-5.2(約 $0.47/任務)。
  • 競爭格局:三天後阿里巴巴發布 24 兆參數 Qwen3.8-Max-Preview,國產大模型競爭正式進入「3T 俱樂部」階段。

以下連結為本文事實依據,發版後請再次開啟核對最新數據:

Moonshot AI 官方 Kimi K3 技術部落格

Hugging Face moonshotai 組織(K3 權重下載)

GitHub moonshotai/FlashKDA(KDA 高效能算子)

Artificial Analysis Intelligence Index

典型高效組合是:Moonshot API 或 OpenRouter 負責 K3 百萬上下文推理,VPSNIX M4/M4 Pro 實體節點負責 Agent 編排、Xcode 編譯鏈與 iOS CI/CD 7×24 部署——雲端 LLM 再強也無法在 Hypervisor 虛擬 macOS 上穩定跑憑證鏈與 Metal 除錯;自架 K3 需要 64 卡超節點,而跑 macOS Agent 需要的是零虛擬化損耗的 Apple 原裝硬體。對於需要零損耗原生算力、穩定 iOS CI/CD 與 AI Agent 自動化的生產環境,VPSNIX 的雲端實體節點通常是更優解:100% Apple 原裝實體機、開放完整 Root 權限、無 Hypervisor 損耗、按天/週/月彈性下單。報價見定價頁

SECTION 06 常見問題 FAQ

Kimi K3 算開源模型嗎?

嚴格來說不算。它屬「開放權重(open weight)」模型:訓練完成的權重檔、技術報告與部分 Infra 工具可公開取得,但訓練資料與完整訓練程式碼未釋出,不符合 OSI 標準下的「開源」定義。

Kimi K3 可以免費商用嗎?

可以,絕大多數商業情境不受限制。但若你營運「模型即服務」且年收入超過 2,000 萬美元,或產品月活超過 1 億/月收入超過 2,000 萬美元,須額外遵守授權條文中的特定義務。

自架 Kimi K3 需要幾張加速卡?

官方建議部署在 64 卡以上的超節點叢集,個人與多數企業使用者較務實的做法是透過官方 API 或 OpenRouter 等第三方平台呼叫。

Kimi K3 效能到底如何?

在開放權重陣營中綜合能力最強,Artificial Analysis 智能指數全球第 3,僅次 Claude Fable 5 與 GPT-5.6 Sol;但成本高於同為開放權重的 GLM-5.2,屬「開放權重陣營天花板最高、但非性價比最優」的選項。

Kimi K3 與 Kimi K2 有何差異?

K3 參數規模約為 K2.5 的三倍,架構新增 Attention Residuals 與 Per-Head Muon,上下文視窗與多模態能力大幅躍升;授權方面 K3 增設 Model-as-a-Service 收入門檻,商用限制比 K2 系列更細緻。