首頁 / 部落格 / Kimi K3
ENGINEERING_BLOG · 2026.07.17

Kimi K3 深度評測:2.8 萬億參數開源大模型新紀錄

KIMI K3 · 總參數量
2.8T

超越 DeepSeek V4 Pro(1.6T)近 75%,迄今全球最大開源 AI 模型。

若你正在評估 2026 年開源大語言模型選型,或需要同時處理長程式碼任務與 Apple 生態開發,2026 年 7 月 16 日月之暗面(Moonshot AI)低調上線的 Kimi K3 應立刻納入比較清單。本文面向 AI 工程師與技術決策者,系統整理 2.8 萬億參數 MoE 架構、Kimi Delta Attention 三大工程創新、與 Claude Fable 5 / GPT-5.6 Sol 的基準對照、$3/$15 定價與 7 月 27 日完整權重開源時程表。結論先行:K3 在持續性長程式任務與文件理解上可對標閉源旗艦,但 iOS/macOS 編譯鏈與 Metal 除錯仍須原生 Apple Silicon 實體機——雲端 API 與本地 M4 節點宜組合部署。

SECTION 01 選大模型寫程式時,開發者常踩的四個坑

  • 上下文視窗虛標:許多模型宣稱 200K+ 上下文,分析大型 Repo 時仍頻繁截斷;K3 提供 100 萬 token 視窗且按標準價計費,適合整庫級推理。
  • 基準分數與實務脫節:短任務 SWE 分數高,不代表能連續寫程式數小時;SWE Marathon 較貼近「實際寫程式」場景,K3 以 42.0 領先。
  • API 無法取代原生編譯環境:再強的雲端 LLM 也無法在 Hypervisor 虛擬 macOS 上穩定執行 Xcode 簽章與 Metal 除錯;與Mac Mini M4 租賃 vs 購買費用對比中討論的實體節點需求互補。
  • 開源承諾與自架門檻落差:參數規模越大,自託管門檻越高——K3 生產級部署需 64 張以上加速卡,7 月 27 日前僅能走 API 或 Kimi.com 消費端。

SECTION 02 Kimi K3 是什麼?發布背景為何關鍵

2026 年 7 月 16 日深夜,月之暗面在 API 文件頂部掛出「Kimi K3 已上線」橫幅——無大型發表會,僅有技術部落格、定價頁與可立即呼叫的模型 ID kimi-k3

一句話定義:Kimi K3 是目前全球參數規模最大的開源 AI 模型——2.8 萬億(2.8T)參數,超越 DeepSeek V4 Pro(1.6T)近 75%,為小米開源模型(1.02T)的 2.7 倍。採稀疏 MoE 架構,推理時從 896 個專家中啟用 16 個;搭配 100 萬 token 超長上下文與原生視覺理解,專為複雜程式、長文件推理與知識工作設計。完整權重將於 2026 年 7 月 27 日在 Hugging Face 開放。

Kimi K3 核心規格
維度 參數
總參數量 2.8 萬億(2.8T)
架構 KDA + AttnRes + Stable LatentMoE
啟用專家 16 / 896(稀疏度 1.8%)
上下文視窗 1,048,576 tokens(1M)
輸入模態 文字、影像、影片
API 定價 $3 / $15 每百萬 token(輸入/輸出)
權重開源 2026 年 7 月 27 日

戰略背景同樣值得關注:過去 12 個月 Kimi 系列有 9 個月佔據開源模型規模上限;發布時點恰在 2026 世界人工智慧大會(WAIC)開幕前夜;截至 2026 年 6 月 ARR 已突破 3 億美元,年內完成第 6 輪融資,投前估值 315 億美元;API 收入佔七成以上,海外付費用戶成長 400%。

SECTION 03 三大架構創新:KDA、AttnRes 與 Stable LatentMoE

Kimi Delta Attention(KDA)——混合線性注意力機制,以 3:1 比例交替線性注意力層與全注意力層:3 個線性層處理局部序列(運算成本低),1 個全注意力層保留全域資訊流。KV 快取記憶體最多減少 75%;百萬 token 上下文下解碼速度最多提升 6.3 倍;短上下文、長上下文與強化學習擴展場景均超越純全注意力基線。

Attention Residuals(AttnRes)——改造深度維度殘差連接,引入選擇性檢索:模型可跨越深度直接拉取更早層的高價值表徵,而非均勻稀釋早期訊號。月之暗面報告約 25% 訓練效率提升,額外運算開銷不足 2%。

Stable LatentMoE——在 896 專家、每次僅啟用 16 個的極端稀疏度下,配套 Quantile Balancing(從路由器得分分位數推導專家分配)、Per-Head Muon(逐注意力頭獨立最佳化)、Sigmoid Tanh Unit(SiTU)與 Gated MLA。相較 Kimi K2,整體擴展效率提升約 2.5 倍。

若全注意力像讓一個人同時記住所有對話細節,KDA 更像高效秘書——多數時候用快速索引,關鍵時刻再精準召回。

SECTION 04 基準測試:Kimi K3 vs Claude Fable 5 vs GPT-5.6 Sol

月之暗面自報核心基準(2026-07-16)
基準 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE 67.5 70.0 73.0 59.0
Program Bench 77.8 76.8 77.6 71.9
Terminal Bench 2.1 88.3 84.6 88.8 84.6
FrontierSWE 81.2 86.6 71.3 66.7
SWE Marathon 42.0 35.0 39.0 40.0
BrowseComp 91.2 88.0 90.4 84.3
OmniDocBench 91.1 89.8 85.8 87.9
GPQA-Diamond 93.5 92.6 94.1 91.0

解讀要點:SWE Marathon 測試持續性長程式工作,K3 以 42.0 大幅領先;Program Bench 與 OmniDocBench 均列第一;Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,緊隨 Claude Fable 5(59.9)與 GPT-5.6 Sol(58.9)。注意:上述為月之暗面自報資料,各模型使用不同推理 harness(K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code),獨立第三方複現仍在進行中。

SECTION 05 定價對照與六步接入 Kimi K3 實操指南

主流模型 API 定價對照($/M token)
模型 輸入 輸出 快取命中輸入 上下文
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00 $15.00 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K

K3 與 Claude Sonnet 5 標準價持平($3/$15),但上下文視窗為其 5 倍;快取命中低至 $0.30/M,程式場景快取命中率超 90%。國內 API:¥20/M 輸入、¥100/M 輸出、快取命中 ¥2/M;Kimi.com 免費帳號可用,預付費 ¥199 起(優惠截至 8 月 11 日)。

  1. 網頁/App 零程式碼體驗:造訪 kimi.com,註冊帳號(支援 Google 登入),K3 預設以最大推理力度執行。
  2. 申請 Moonshot API Key:在 platform.kimi.ai 建立金鑰,確認帳戶餘額與速率限制。
  3. 設定 OpenAI 相容用戶端:設定 base_url=https://api.moonshot.ai/v1,模型 ID 填 kimi-k3
  4. 驗證首次呼叫:傳送短 prompt 確認 token 計費與回應延遲符合預期。
  5. (可選)接入 OpenRouter:模型 ID moonshotai/kimi-k3,官方定價無加價,保留 1M 上下文。
  6. 標記 7 月 27 日權重發布:關注 Hugging Face 官方儲存庫,屆時評估 vLLM / SGLang 量化版本與自架門檻(需 64+ 加速卡超節點)。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "分析這段程式碼的效能瓶頸..."}]
)

SECTION 06 場景選型、開源時程與可引用資料

依場景選擇模型
場景 推薦 原因
持續性長程式任務 Kimi K3 SWE Marathon 第一,上下文最長
複雜 Repo 級修 Bug Claude Fable 5 FrontierSWE 大幅領先
終端/工具鏈 Agent GPT-5.6 Sol Terminal Bench 領先
超長文件/多模態理解 Kimi K3 OmniDocBench 第一
成本敏感 DeepSeek V4 Pro 輸出 $3.48/M
開源自架(7/27 後) Kimi K3 最強開源權重

可引用硬核資料:

  • 參數量:2.8T 總參數,896 專家 MoE,每次啟用 16 個(稀疏度 1.8%)
  • KDA 效率:KV 快取記憶體 -75%,百萬 token 解碼 +6.3×
  • AttnRes:訓練效率 +25%,額外算力 <2%
  • 相對 K2:擴展效率 +2.5×
  • Intelligence Index v4.1:K3 得分 57.1,全球第四
  • ARR / 估值:2026 年 6 月 ARR 超 $300M,投前估值 $31.5B
  • 關鍵日期:7 月 17–20 日 WAIC → 7 月 27 日 Hugging Face 完整權重

官方與第三方參考來源(發版後請再次開啟連結核對):

Moonshot AI — Kimi K3 官方技術部落格

Kimi API Platform — 定價與 Quickstart 文件

Artificial Analysis — Intelligence Index v4.1 排行

Kimi K3 在架構與基準上證明開源大模型可正面挑戰閉源旗艦,但雲端 LLM 無法取代 Xcode 編譯、Metal 著色器除錯與 iOS 憑證鏈;虛擬化 macOS 則伴隨 EULA 風險與 20–40% 效能損耗。典型高效組合是:K3 API 負責長上下文程式推理與文件分析,VPSNIX M4/M4 Pro 實體節點負責原生編譯與 AI Agent 7×24 部署——100% 原廠硬體、完整 Root 權限、無 Hypervisor 損耗、按天彈性下單。報價見定價頁;若關注AI 硬體與訴訟動態,更應把算力鎖定在合規實體環境而非賭未決商業敘事。

SECTION 07 常見問題 FAQ

Kimi K3 可以免費使用嗎?

可以——kimi.com 免費帳號即可體驗 K3(目前僅 max 推理力度)。API 按 token 計費,標準價 $3/$15 每百萬 token。

能否在本地執行 Kimi K3?

7 月 27 日前不行;權重開放後生產級推理需 64 張以上加速卡超節點,不適合筆電部署。

K3 與 DeepSeek V4 Pro 怎麼選?

K3 參數近 2 倍(2.8T vs 1.6T)、上下文 1M vs 128K、多項基準更強;DeepSeek 輸出僅 $3.48/M,成本顯著更低。

100 萬 token 上下文實際有用嗎?

對整庫程式碼分析、長篇法律/科研文件、多輪 Agent 長記憶尤其有價值;且 K3 不按長度加價,鼓勵真正用滿視窗。