/ 블로그 / K3 공개
ENGINEERING_BLOG · 2026.07.28

Kimi K3 완전 공개: 2.8조 MoE·100만 컨텍스트, 11일 만의 오픈 웨이트

KIMI K3 · 총 파라미터
2.8T

세계 최초로 전체 웨이트가 공개된 3T급 모델, Hugging Face 약 1.56TB.

2026년 7월 27일 23시경 Moonshot AI(월지암면)는 Kimi K3 전체 모델 웨이트·기술 보고서를 공개하고, 학습 인프라 핵심 3종(MoonEP, FlashKDA, AgentEnv)을 동시 오픈소스로 내놓았습니다. K3는 총 2.8조 파라미터 MoE(활성 약 1,040억), 100만 토큰 컨텍스트, 네이티브 비전 이해를 갖춘 모델입니다. 본문은 AI 개발자·ML 엔지니어·라이선스 검토 담당자를 대상으로 API 선행(7/16)부터 전량 공개(7/27)까지 11일 타임라인, KDA·AttnRes·Per-Head Muon 아키텍처, 벤치마크·커스텀 라이선스 2대 상업 임계값, 64카 self-host 현실을 밀도 있게 정리합니다. 핵심 결론: K3는 오픈 웨이트 진영의 능력 상한이지만 OSI 의미의 오픈소스는 아니며, 대부분의 팀에게는 64카 자체 호스팅보다 공식 API·OpenRouter가 현실적입니다.

SECTION 01 K3 공개 전 반드시 짚어야 할 5가지 오해

  • 「오픈소스」≠ OSI 오픈소스: Moonshot 공식 자료는 일관되게 「open weight」를 사용합니다. 가중치·기술 보고서·일부 Infra만 공개되며 학습 데이터·전체 학습 코드는 비공개입니다.
  • Modified MIT 종료: K3는 커스텀 라이선스로 전환했습니다. MaaS 연매출 2,000만 달러, 또는 MAU 1억·월매출 2,000만 달러 구간에서 추가 의무가 발생합니다.
  • 자체 배포 난이도: 896 experts·1.56TB 웨이트·공식 64카 슈퍼노드 권장 — 소비자·중견 GPU 클러스터로는 현실적이지 않습니다.
  • 가성비 한계: Artificial Analysis 태스크당 약 $0.95 — Claude Fable 5 대비 60% 저렴하나 GLM-5.2(약 $0.47)보다 비쌉니다. 7/22 공개 예고 시점 Modified MIT 전제는 폐기되었습니다.
  • 지정학적 맥락: 7/22–23 미·중 증류 논쟁과 7/28 중국 상무부 대응이 기술 릴리스를 넘어선 신호로 작용합니다.

SECTION 02 API 선행부터 전량 공개까지: 11일 타임라인과 핵심 스펙

이번 공개는 kimi.com·API 최초 가동(7/16) 이후 단 11일 만에 이뤄졌습니다. 주요 마일스톤은 다음과 같습니다.

  • 7/16(WAIC 2026 직전): kimi.com·Kimi Work·Kimi Code·Kimi API에서 K3 선행 가동, 웨이트 미공개.
  • 7/17: 업계 아키텍처 분석 집중, 신화통신「현재 세계 최대 파라미터 오픈 모델」보도.
  • 7/22–23: 미·중 모델 증류 분쟁 격화, Anthropic Fable 모델 산업화 증류 의혹.
  • 7/27 23시: 전체 웨이트·기술 보고서 공개, MoonEP·AgentEnv 오픈(FlashKDA는 선행 공개).
  • 7/28: 중국 상무부 공식 대응, 국내 매체 후속 보도. 3일 후 Alibaba Qwen3.8-Max-Preview(24T) 발표.
Kimi K3 핵심 파라미터
항목
총 파라미터 2.8조(2.8T)
활성 파라미터 약 1,040억
아키텍처 MoE(혼합 전문가)
Expert 구성 896 routing experts, 토큰당 16 활성(+ shared experts)
어텐션 KDA + Gated MLA
컨텍스트 100만 토큰
멀티모달 네이티브 비전(ViT-V2, 27층)
웨이트 형식 MXFP4 가중치 + MXFP8 활성(SFT 단계 QAT)
웨이트 용량 약 1.56TB(Hugging Face)
License 커스텀 라이선스(open weight, open source 아님)

SECTION 03 KDA·AttnRes·Per-Head Muon과 오픈 Infra 3종

K3는 어텐션·잔차 연결·옵티마이저라는 딥러닝 3대 관성 컴포넌트를 재설계했습니다. 단순 파라미터 적층이 아닌 구조 혁신이 벤치마크 격차의 핵심입니다.

  • Kimi Delta Attention(KDA): Gated DeltaNet의 스칼라 망각 게이트를 채널별 독립 감쇠로 확장, chunkwise DPLR로 선형 시간 재귀를 구현합니다. Gated MLA와 교차 배치해 100만 토큰에서 KV Cache 부담을 억제합니다.
  • Attention Residuals(AttnRes): 균일 잔차 합산 대신 입력 의존적 선택적 집계. 층당 RMSNorm 1개·pseudo-query 1개 추가로 학습 효율 약 25% 향상, 오버헤드 2% 미만.
  • Per-Head Muon: 어텐션 헤드별 독립 Muon 최적화로 수렴 경로를 분리합니다. 추론 API 사용자에게는 투명한 학습기법입니다.
  • Stable LatentMoE: 896→16 sparse routing(희소도 ~1.8%), Quantile Balancing + MoonEP로 노드당 redundant expert 상한을 이론적으로 증명합니다.
동시 공개 Infra 3종
기술 역할 핵심 능력
MoonEP 초대규모 fine-grained MoE 통신 라이브러리 과부하 expert 임시 복제, 노드별 균등 token 분배, redundant expert 상한 증명
FlashKDA CUTLASS 기반 KDA 고성능 연산자(선행 공개) H20 prefill 1.72–2.22×, flash-linear-attention chunk_kda 대체 백엔드
AgentEnv KVCache.ai 공동 Agent 샌드박스(Firecracker microVM) 대규모 병렬 Agent RL, checkpoint 133ms·복구 49ms·메모리 오버서브scription 6.5×
SWE-bench Verified 독립 재측정(Vals AI, 2026년 7월)
모델 점수 출시일
Claude Opus 5 97% 2026-07-24
GPT-5.6 Sol 96.2% 2026-07-09
Claude Fable 5 95% 2026-06-09
Kimi K3 93.4% 2026-07-16
Qwen3.7-Max 79.4% 2026-05-19
DeepSeek-V4 76.2% 2026-04-23

Artificial Analysis Intelligence Index(max 추론): Claude Fable 5 60, GPT-5.6 Sol 59, Kimi K3 약 57(글로벌 3위·오픈 웨이트 1위), GLM-5.2 51. Arena.ai Frontend Code Arena 1위를 기록 중입니다.

K3는 3T급 오픈 웨이트 중 종합 능력이 최상위이나, GLM-5.2 대비 단가가 높아 「능력 상한」과 「가성비 최적」은 동시에 충족하지 않습니다.

SECTION 04 K3 API 연동·라이선스 검토 6단계

  1. 커스텀 라이선스 정독: MaaS 연매출 2,000만 달러, MAU 1억·월매출 2,000만 달러 임계값 해당 여부를 법무와 확인합니다.
  2. Moonshot API 등록: 모델 ID kimi-k3, 엔드포인트 https://api.moonshot.ai/v1에서 API Key를 발급받습니다.
  3. OpenAI SDK 호환 클라이언트: base_url·api_key만 교체하면 Chat Completions 로직은 대부분 그대로 사용 가능합니다.
  4. Prompt Caching 활성화: Mooncake 분리형 추론에서 코딩 워크로드 캐시 히트율 90% 초과 사례가 보고되어 실입력 단가가 $0.30/M에 근접합니다.
  5. OpenRouter Fallback 검토: 다중 모델·통합 청구가 필요하면 OpenRouter 경유 K3(7개 프로바이더, 공식가 수준)를 평가합니다.
  6. Self-host TCO 산출: 64카 이상 슈퍼노드·1.56TB 스토리지·전력·SRE 인력 대 API 호출량을 비교해 자체 배포 여부를 결정합니다.
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(response.choices[0].message.content)

SECTION 05 API 요금·핵심 수치·1차 출처

Kimi K3 API 요금(백만 토큰당)
토큰 유형 가격
입력(캐시 히트) $0.30
입력(캐시 미스) $3.00
출력(추론 포함) $15.00
  • 웨이트 용량: Hugging Face 1.56TB, 공개 30분 내 트렌드 1위.
  • 희소도: 896 experts 중 토큰당 16 활성, ~1.8%.
  • FlashKDA: H20 prefill 1.72–2.22×, chunk_kda 직접 대체 가능.
  • 비용 포지션: 태스크당 ~$0.95(AA), Fable 5 대비 ~60% 저렴, GLM-5.2 대비 고가.
  • 경쟁: 3일 후 Alibaba Qwen3.8-Max-Preview(24T) — 국산 LLM 「3T 클럽」 경쟁 본격화.

아래 1차 출처는 발행 후 재확인하시기 바랍니다.

Moonshot AI Kimi K3 공식 기술 블로그

Hugging Face moonshotai(K3 웨이트)

GitHub moonshotai/FlashKDA

Artificial Analysis Intelligence Index

실전 조합은 Moonshot API·OpenRouter로 100만 토큰 K3 추론, VPSNIX M4/M4 Pro 물리 노드로 Agent 오케스트레이션·Xcode 빌드·iOS CI/CD 7×24 운영입니다. 클라우드 LLM은 Hypervisor macOS에서 인증서 체인·Metal 디버깅을 안정적으로 처리하지 못합니다. K3 self-host는 64카, macOS Agent는 제로 가상화 Apple 하드웨어가 필요합니다. 100% Apple 물리기·full root·일/월 탄력 과금 — 요금을 확인하세요.

SECTION 06 자주 묻는 질문 FAQ

Kimi K3는 진짜 오픈소스 모델인가요?

엄밀히는 아닙니다. 오픈 웨이트 모델로, 학습 완료 가중치·기술 보고서·일부 Infra는 공개되었으나 학습 데이터·전체 학습 코드는 비공개입니다. OSI 정의상 오픈소스에 해당하지 않습니다.

Kimi K3를 상업적으로 무료 사용할 수 있나요?

대부분의 상업 시나리오에서 제한 없이 가능합니다. Model-as-a-Service 연매출 2,000만 달러 초과, 또는 MAU 1억·월매출 2,000만 달러 초과 시 라이선스 추가 조항을 충족해야 합니다.

Kimi K3 자체 배포에 GPU가 몇 장 필요한가요?

공식 권장은 64카드 이상 슈퍼노드입니다. 개인·중소기업은 Moonshot API 또는 OpenRouter 호출이 현실적입니다.

Kimi K3 성능은 실제로 강한가요?

오픈 웨이트 진영 종합 1위, Artificial Analysis Intelligence Index 글로벌 3위(57점)입니다. GLM-5.2 대비 비용이 높아 가성비 최적은 아닙니다.

Kimi K3와 Kimi K2의 차이는 무엇인가요?

K3는 K2.5 대비 파라미터 약 3배, Attention Residuals·Per-Head Muon 추가, 100만 토큰·네이티브 비전을 지원합니다. 라이선스는 MaaS 매출 임계값이 신설되었습니다.