/ 블로그 / Kimi K3
ENGINEERING_BLOG · 2026.07.22

Kimi K3 오픈 웨이트: 공개 일정·벤치마크·자체 호스팅 현실

KIMI K3 · Open Weights
7/272026

2.8T 파라미터 Modified MIT 공개 — 역대 최대급 오픈 웨이트 배포입니다.

Moonshot AI는 1,048,576 토큰 컨텍스트를 갖춘 2.8조 파라미터 MoE 모델 Kimi K3의 전체 웨이트를 2026년 7월 27일 Modified MIT 라이선스로 공개합니다. kimi k3 open weights 동향을 추적하는 ML 엔지니어, Claude Fable 5·GPT-5.6 Sol 대비 비용 효율을 검토하는 기술 리더, Hugging Face 공개 전 자체 호스팅 전략을 수립하는 SRE를 위해 타임라인·스펙·벤치마크·API 요금·하드웨어 현실·업계 파급·공개일 체크리스트를 5개 축으로 정리합니다. 핵심 결론: K3는 Fable 5를 완전히 대체하지 못하지만 Artificial Analysis Intelligence Index 57.1(189개 모델 중 3위)을 기록했으며, 태스크당 $0.94로 Fable 5 대비 65.8% 저렴하고 1M 컨텍스트와 오픈 웨이트라는 차별점을 제공합니다.

SECTION 01 Kimi K3 오픈 웨이트, 숙련 ML 엔지니어도 헷갈리는 5가지 포인트

  • 공개일이 두 단계: 7월 16일 API·Kimi 앱 선행 가동, 7월 27일 HF 전체 웨이트. 검색 의도가 날짜별로 갈라져 혼동하면 스니펫 적격성을 잃습니다.
  • 오픈 웨이트≠오픈소스: 체크포인트 다운로드는 가능하지만 학습 코드·데이터셋은 포함되지 않습니다. 용어 혼용은 r/LocalLLaMA·HN에서 신뢰도를 떨어뜨립니다.
  • 자체 호스팅 헤드라인의 함정: 4-bit 양자화만 약 1.4TB, 공식 가이드는 64기 이상 가속기 슈퍼노드 구성을 권장합니다. 노트북 실행은 비현실적입니다.
  • 벤치마크 하네스 민감도: Moonshot은 추론 내용을 반환하는 하네스에 민감하고 모호한 의도에 과잉 반응한다고 공식 인정했습니다. 크로스 벤더 비교에는 측정일·전제 명시가 필수입니다.
  • 클로즈드 모델의 대화 품질 우위: GDPval v2 Elo·DeepSWE에서 Fable 5·Sol이 여전히 앞섭니다. K3는 지속 코딩·자동화 벤치에서 강점 — 워크로드 기준으로 선택하세요.

SECTION 02 Kimi K3 공개 타임라인과 핵심 스펙

Kimi K3 마일스톤
날짜 이벤트
2026-07-16 API·Kimi App·Kimi Work·Kimi Code 가동. Artificial Analysis 독립 평가 동일 공개
2026-07-17 상하이 WAIC 개막. 신화통신 K3를 국가 AI 마일스톤으로 보도
2026-07-27 Hugging Face 전체 2.8T 웨이트(Modified MIT) + 기술 보고서(아키텍처·학습·평가)
Kimi K3 모델 스펙 요약
항목 상세
총 파라미터 2.8조(2.8T) — 현재 최대급 오픈 웨이트
아키텍처 Sparse MoE — Stable LatentMoE, 896 experts, 토큰당 16 활성화
어텐션 Kimi Delta Attention(KDA, 하이브리드 선형) + Attention Residuals(AttnRes) + Gated MLA
컨텍스트 1,048,576 토큰(약 1M)
모달리티 네이티브 비전(텍스트+이미지). 제품 티어는 동영상 이해 추가. 출력은 텍스트
웨이트 형식 MXFP4 웨이트 + MXFP8 활성화(네이티브 저정밀 학습)
스케일링 효율 동일 연산량 대비 K2 대비 약 2.5배(공식 주장)
학습 안정성 Quantile Balancing(전문가 라우팅), Per-Head Muon 옵티마이저, SiTU 활성화
장컨텍스트 디코드 1M 토큰에서 KDA 최대 6.3배 디코드 가속

K3는 약 3T급 최초의 오픈 웨이트 모델로 포지셔닝됩니다 — 모든 벤치마크에서 클로즈드 플래그십을 제압한다는 주장이 아니라, 클로즈드소스 가격 프리미엄에 도전하는 설계입니다.

SECTION 03 Kimi K3 벤치마크: Claude Fable 5·GPT-5.6 Sol 횡단 비교

Artificial Analysis Intelligence Index(2026년 7월 16일 측정):

종합 지능 점수(Artificial Analysis, 2026.7.16)
모델 점수 순위
Claude Fable 5 59.9 1
GPT-5.6 Sol 58.9 2
Kimi K3 57.1 3 / 189

K3 우위·동률 영역: Frontend Code Arena #1(UI 코드 블라인드 평가에서 Fable 5·Sol 상회); Automation Bench·SpreadsheetBench 2 #1; BrowseComp 91.2(#1, 1M 비압축 전략 90.4+); SWE Marathon 42.0(장시간 코딩 — GPT-5.5·GLM-5.2는 10대 초반으로 급락); Terminal Bench 2.1 88.3(Sol 88.8 근접); Program Bench 77.8(Sol 77.6 근소 우위); FrontierSWE 81.2(Sol 71.3 크게 상회, Fable 5 86.6에는 미달).

K3 열위 영역: GDPval v2 Elo 1668–1687(Fable 5 1760, Sol 1748); DeepSWE 67.5(Sol 73.0); 환각률 K2.6 대비 상승(공식 인정); Reddit 사용자는 자체 호스트 환경에서 상위 클로즈드 모델 대비 환각이 많다고 보고; 대화 다듬기·단일 세션 분산이 Fable 5·Sol에 뒤집니다.

아키텍처 심층 분석은 Kimi K3 오픈소스 LLM 리뷰, 다른 오픈 웨이트 후보는 DeepSeek V4 GA 출시 분석을 참고하세요.

SECTION 04 Kimi K3 API 요금과 캐시 반영 실비용

Kimi K3 API 요금(USD/100만 토큰)
항목 가격
입력(캐시 미스) $3.00
입력(캐시 히트, 자동) $0.30
출력 $15.00

중국 LLM 벤더 중 최고 요금대이나 Claude Opus 4.8 단일 태스크 비용보다는 훨씬 낮습니다. Artificial Analysis는 K3 태스크당 $0.94를 측정 — GPT-5.6 Sol 대비 9.4% 저렴, Claude Fable 5 대비 65.8% 저렴합니다. 코딩 워크로드에서 캐시 히트율 90% 초과 사례가 보고되어 표 요금보다 실지출이 낮아지는 경우가 많습니다.

SECTION 05 Kimi K3는 오픈소스인가? — 오픈 웨이트 vs 오픈소스

7월 27일 Moonshot은 Hugging Face에 전체 2.8T 웨이트를 Modified MIT 라이선스(정확한 조항은 공개일 확인)로 배포하고 아키텍처·학습·평가 기술 보고서를 동시 공개합니다. KDA·프리픽스 캐싱 지원 vLLM이 웨이트와 동시기 도착할 전망이며, Ollama·GGUF 양자화는 K2 시리즈 선례를 따를 것으로 보입니다.

용어 정리: K3는 오픈 웨이트 릴리스 — 라이선스 조건 하 체크포인트 다운로드·실행이 가능합니다. 학습 코드·데이터셋을 포함한 오픈소스는 아닙니다. 컴플라이언스 팀과 is kimi k3 open source류 쿼리 응답 시 이 구분을 명시하세요.

SECTION 06 Kimi K3 로컬 실행 가능 여부 — 하드웨어 요건과 공개일 체크리스트

솔직한 답: 일반 하드웨어로는 불가능합니다. 4-bit 양자화 웨이트만 약 1.4TB. 공식은 expert parallelism + tensor parallelism 슈퍼노드에 64기 이상 가속기를 권장합니다. 참고: 1T 파라미터 K2.7 Code는 INT4 기준 약 577GB VRAM — K3는 2.8배 규모입니다.

자체 호스팅이 합리적인 경우는 (1)데이터 레지던시·오프라인 요건, (2)독점 데이터 파인튜닝, (3)API 비용을 상회하는 호출량 — 세 가지에 해당할 때뿐입니다. 그 외에는 M tokens당 $3/$15 API가 정답입니다.

  1. Hugging Face 조직 워치: 7월 27일 전 Moonshot AI를 팔로우해 리포지토리 공개를 즉시 감지합니다.
  2. 공개일 LICENSE 전문 확인: Modified MIT는 표준 MIT와 다를 수 있으므로 조항을 반드시 정독합니다.
  3. 웨이트 샤드·양자화 형식 검증: MXFP4 번들과 커뮤니티 INT4/GGUF 배포를 확인합니다.
  4. vLLM 릴리스 노트 추적: KDA·프리픽스 캐싱 지원 커밋을 프로덕션 전 고정합니다.
  5. 기술 보고서에서 최소 하드 문서화: 가속기 수·인터커넥트·병렬 전략을 클러스터 예산과 대조합니다.
  6. 장컨텍스트 테스트 독립 재현: 1M 토큰 디코드 주장은 자사 하네스로 검증합니다.
  7. API vs 자체 TCO 비교: 전력·네트워크·운영 인력·캐시 히트율을 코딩 에이전트 전제로 산출합니다.

SECTION 07 7월 27일 웨이트 공개가 업계에 주는 4가지 시사점

  • 오픈·클로즈드 격차 거의 소멸: Intelligence Index 격차가 수백 점에서 한 자릿수로 축소 — 능력만으로 클로즈드 프리미엄을 정당화하기 어렵습니다.
  • 지정학적 배경: K3는 WAIC 2026 직전 등장. 한 달 전 미국이 Anthropic Fable/Mythos 모델 일시 디리스트(7월 1일 복구). 웨이트 공개 후 규제로 되돌릴 수 없습니다 — 오픈 웨이트 옹호의 새 논거입니다.
  • 중국 벤더 웨이브: Z.ai GLM-5.2(Opus 4.8급 코딩 약 1/5 가격), DeepSeek V4 Pro(1.6T), MiniMax 등 — K3는 이번 사이클의 정점입니다.
  • Moonshot 재부상: 2025년 초 DeepSeek R1 충격으로 국내 7위 후퇴 뒤 K2→K2.5→K3 오픈 웨이트 로드맵으로 신뢰 회복했습니다.

SECTION 08 인용 가능 기술 데이터와 1차 정보원

  • 파라미터: 2.8T 총량; MoE 896 experts, 토큰당 16 활성
  • 컨텍스트: 1,048,576 토큰
  • Intelligence Index: K3 57.1 / Sol 58.9 / Fable 5 59.9(AA, 2026.7.16)
  • 태스크 단가: K3 $0.94 — Fable 5 대비 65.8% 저렴
  • API: 입력 $3 미스 / $0.30 히트 / 출력 $15 per M tokens
  • 자체 스토리지: 4-bit 약 1.4TB; 64기 이상 가속기 권장
  • 라이선스: Modified MIT(7.27 전문 확인)
  • 코딩 하이라이트: Frontend Code Arena #1; SWE Marathon 42.0

공식·독립 평가 참조 — 업스트림 갱신 후 링크를 재확인하세요:

Moonshot AI — Kimi K3 공식 기술 블로그

Kimi Platform — API 문서 및 요금

Artificial Analysis — Intelligence Index 및 비용 벤치마크(2026.7.16)

K3 오픈 웨이트는 프론티어급 AI 경제성을 바꾸지만 Xcode 프로젝트 컴파일, iOS 바이너리 서명, Metal 셰이더 디버깅까지는 담당하지 않습니다. 가상화 macOS 스택은 EULA 리스크와 측정 가능한 오버헤드를 동반합니다. 실전 프로덕션 패턴은 K3 API(또는 향후 자체 엔드포인트)로 100만 토큰 추론·에이전트 오케스트레이션을 수행하고 VPSNIX M4/M4 Pro 물리 노드에서 Apple Silicon 네이티브 빌드를 실행하는 이중 스택입니다 — 100% Apple 하드, full root, 가상화 택스 제로, 일·월 탄력 과금. 요금을 확인하고 장시간 에이전트는 규정 준수 물리 인프라에 탑재하세요.

SECTION 09 자주 묻는 질문 FAQ

Kimi K3 웨이트는 언제 공개되나요?

2026년 7월 27일입니다. API와 Kimi 앱은 7월 16일 선행 가동했으며, 다운로드 가능한 전체 체크포인트와 기술 보고서는 27일 Hugging Face Modified MIT로 공개됩니다.

Kimi K3는 진짜 오픈소스인가요?

오픈 웨이트 릴리스입니다 — 라이선스 체크포인트를 받을 수 있습니다. 학습 코드·데이터셋은 7월 27일 배포에 포함되지 않습니다. 제목에는「오픈 웨이트」, 본문에서 뉘앙스를 설명하세요.

Kimi K3 이용 요금은 얼마인가요?

API 표 요금: 입력 $3/M(캐시 미스), $0.30/M(캐시 히트), 출력 $15/M. Artificial Analysis 대표 태스크 단가 약 $0.94 — Claude Fable 5 대비 65.8% 저렴합니다.

일반 GPU로 Kimi K3를 실행할 수 있나요?

현실적이지 않습니다. 4-bit 약 1.4TB, 공식은 64기 이상 가속기 분산 슈퍼노드를 권장합니다. 데이터센터급 하드가 없으면 API를 사용하세요.

K3가 Claude Fable 5나 GPT-5.6 Sol보다 우수한가요?

종합 Intelligence Index 기준 아닙니다 — K3 57.1(3위), Fable 5 59.9, Sol 58.9. 특정 코딩·자동화 벤치에서는 우위이며 태스크 단가는 훨씬 저렴합니다. 워크로드 기준으로 선택하세요.

Kimi K3 라이선스는 무엇인가요?

Modified MIT입니다. 7월 27일 Hugging Face 릴리스에서 전문이 공개됩니다. 상업 재배포·파인튜닝 재배포 전 실제 파일을 반드시 읽으세요.