Alibaba가 2026년 8월 3일 Qwen3.8-Max를 정식 출시(GA)했습니다. 총 2.4조(2.4T) 파라미터 MoE, 토큰당 950억(95B) 활성, 100만 토큰 컨텍스트, Arena 텍스트 5위·비전 2위, API $2/$6 per M tokens——7월 WAIC에서 Preview로 공개됐을 때는 벤치마크가 없었으나, GA와 함께 전체 성능표·기술 문서·API 요금이 동시 공개되었습니다. 본문은 Kimi K3·DeepSeek V4·Claude Opus 5와의 경쟁 위치, 오픈 웨이트 일정(다음 주 Hugging Face·ModelScope), QwenWork 에이전트 플랫폼, 그리고 프로덕션 도입 전 6단계 평가 체크리스트를 정리합니다.
SECTION 01 Qwen3.8-Max GA, 숙련 ML 엔지니어도 헷갈리는 5가지 포인트
7월 31일 Kimi K3 전체 웨이트 공개 4일 후 Alibaba가 Max급 플래그십을 GA했습니다. WAIC 2026에서 Qwen3.8-Max-Preview로 선보였던 모델이 벤치마크 없이 API만 제공되던 상태에서, 8월 3일 전면 공개로 전환되었습니다.
- Preview와 GA의 벤치마크 격차: 7월 Preview 단계에서는 Arena 순위·내부 벤치마크가 공개되지 않았습니다. GA와 함께 Text Arena 5위, Vision Arena 2위, Frontend Code Arena 4위(1,668점) 등 독립 리더보드 수치가 처음 등장했습니다——「벤치마크 투명성」 논쟁의 핵심 전환점입니다.
- 오픈 웨이트는 「다음 주」: API는 8월 3일 즉시 가동(QwenCloud·Alibaba Cloud Model Studio)이나, Max급 Qwen 역사상 첫 오픈 웨이트는 8월 10일 전후 Hugging Face·ModelScope 예정입니다. K3는 7월 27일 이미 2.8T 전체 웨이트를 공개한 상태입니다.
- 2.4T/95B는 K3(2.8T/104B)보다 작지만 요금은 훨씬 저렴: Qwen3.8-Max API는 입력 $2/M·출력 $6/M——K3($3/$15) 대비 입력 33%·출력 60% 저렴합니다. Arena Frontend Code에서는 K3(Max) 1,676점이 1위권, Qwen3.8-Max 1,668점으로 4위입니다.
- 「오픈소스」가 아닌 「오픈 웨이트」: Alibaba 공식 표현은 open weights입니다. 학습 코드·데이터셋 포함 여부는 웨이트 공개일 LICENSE 전문 확인이 필요합니다——K3 Modified MIT 선례와 동일한 주의가 적용됩니다.
- QwenWork 동시 베타: Tencent WorkBuddy·Kimi Work와 경쟁하는 올인원 직장 AI 에이전트 플랫폼이 같은 날 공개 베타로 출시되었습니다. 모델 단독 API와 Agent 오케스트레이션 레이어를 분리해 평가해야 합니다.
SECTION 02 출시 타임라인·핵심 스펙·Arena 벤치마크
| 날짜 | 이벤트 |
|---|---|
| 2026-07-19 | Alibaba 공식 트윗: 「출시 및 오픈 웨이트 예정」 예고 |
| 2026-07-28 | WAIC 2026 직후 Qwen3.8-Max-Preview API 선행 가동(벤치마크 미공개) |
| 2026-07-31 | Moonshot Kimi K3 전체 2.8T 웨이트 공개——국산 LLM 「3T 클럽」 경쟁 본격화 |
| 2026-08-03 | Qwen3.8-Max GA: 전체 벤치마크·기술 문서·API 요금·QwenWork 베타 동시 공개 |
| 2026-08-10(예정) | Max급 Qwen 최초 오픈 웨이트——Hugging Face·ModelScope 배포(Qwen3.8-27B 동시 예정) |
| 항목 | 스펙 |
|---|---|
| 총 파라미터 | 2.4조(2.4T) |
| 활성 파라미터 | 토큰당 약 950억(95B) |
| 아키텍처 | Sparse MoE + 하이브리드 어텐션(Qwen 3.5 기반) |
| 컨텍스트 | 100만 토큰(최대 입력 991K, 최대 출력 131K, 추론 체인 최대 262K) |
| 멀티모달 | 텍스트·이미지·비디오 네이티브 입력 |
| API 모델 ID | qwen3.8-max(QwenCloud·Model Studio) |
| 오픈 웨이트 | 8월 10일 전후 예정(Max급 Qwen 최초) |
| 리더보드 | Qwen3.8-Max 순위 | 점수·비고 |
|---|---|---|
| Text Arena | 5위 | 글로벌 텍스트 종합 순위 |
| Vision Arena | 2위 | Claude Fable 5에만 뒤짐 |
| Frontend Code Arena | 4위 | 1,668점 — Claude Opus 5(Max) 1,705, Kimi K3(Max) 1,676, Opus 5(High) 1,669 |
| Consumer Product | 2위 | 소비자 제품 시나리오 |
| PaperBench(Alibaba 자체) | 1위급 | 93.0%——학술 논문 재현·방법론 혁신 |
Preview 단계에서 GA로 넘어가며 Alibaba가 처음 공개한 독립 벤치마크 수치입니다. Text Arena 5위는 「글로벌 프론티어」 진입을 의미하지만, Frontend Code 4위는 Kimi K3·Claude Opus 5에 아직 미달합니다.
SECTION 03 Sparse MoE·하이브리드 어텐션과 벤치마크 투명성 쟁점
Qwen3.8-Max는 Qwen 3.5 위에 Sparse Mixture-of-Experts(MoE)와 하이브리드 어텐션을 결합했습니다. 2.4T 총량 중 토큰당 95B만 활성화해, 동급 dense 모델 대비 추론 비용·지연을 낮추는 설계입니다.
- 추론 효율: 95B 활성은 Kimi K3(104B)보다 약 9% 적지만, 총 파라미터 2.4T는 K3(2.8T)보다 14% 작습니다. 자체 호스팅 시 VRAM·스토리지 부담이 K3(약 1.56TB)보다 낮을 가능성이 있으나, 웨이트 공개 전까지는 추정치입니다.
- 장기 Horizon Agent: Alibaba 내부 테스트에서 16일간 자율 SWE 프로젝트를 수행해 oh-my-cli 프레임워크를 GitHub에 오픈소스로 공개했습니다. RecreationBench(블랙박스 앱 재현)도 함께 발표되었으나, 제3자 독립 복현은 아직 없습니다.
- 멀티모달 지식 구조화: 수백 페이지 문서·TV 시리즈 전편·100시간 라이브스트림을 검색 가능한 지식 베이스로 변환. UI 스크린샷 1장에서 프론트엔드 전체 재구성, 2D 평면도→3D 인테리어 시각화 등 Vision Arena 2위를 뒷받침하는 데모가 공개되었습니다.
- 벤치마크 투명성 전환: 7월 Preview는 「파라미터 수만 공개, 성능표 없음」 상태였습니다. 8월 3일 GA에서 Arena·PaperBench·내부 SWE 사례가 일괄 공개되었으나, SWE-bench Verified 등 Vals AI 독립 재측정 수치는 아직 없습니다——Kimi K3가 SWE-bench 93.4%를 Vals AI 표에 올린 것과 대조됩니다.
- Apple Intelligence 중국 연결: Qwen은 이미 중국향 Apple Intelligence 생성 AI 백엔드로 등록되어 있습니다. Qwen+Baidu 이중 모델 구조와 별개로, Qwen3.8-Max GA는 엔터프라이즈·글로벌 API 시장을 겨냥합니다.
SECTION 04 Kimi K3·DeepSeek V4·Claude Opus 5 경쟁 모델 비교
| 모델 | 총/활성 파라미터 | API(입력/출력 per M) | 오픈 웨이트 | 핵심 포지션 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 95B | $2 / $6 | 8/10 전후 예정 | Arena Text 5위, Vision 2위, 가성비 API |
| Kimi K3 | 2.8T / 104B | $3 / $15 | 7/27 공개(Modified MIT) | Frontend Code Arena 1위권, Intelligence Index 57.1(3위) |
| DeepSeek V4 Pro | 1.6T(추정) | 피크 $0.87/M 출력(오프피크 더 저렴) | GA 오픈 웨이트 | SWE-bench 80.6% 오픈소스 최고(2026.7), 초저가 API |
| Claude Opus 5 | 비공개 | $15 / $75(추정) | 클로즈드 | SWE-bench 97%, Frontend Code 1,705(Max) |
| GPT-5.6 Sol | 비공개 | $5 / $30 | 클로즈드 | Intelligence Index 58.9, 범용 프론티어 |
선택 가이드: 코딩 Agent·장기 SWE에서 최고 순위가 필요하면 Kimi K3(또는 Claude Opus 5)가 여전히 우위입니다. 멀티모달·비전 중심 워크로드(Vision Arena 2위)와 API 비용 민감도가 높으면 Qwen3.8-Max가 유리합니다. 오픈 웨이트 자체 호스팅이 급하면 K3는 이미 7월 27일 공개 완료, Qwen3.8-Max는 8월 10일 전후를 기다려야 합니다. 초저가 API만 필요하면 DeepSeek V4 피크/오프피크 요금이 더 낮습니다.
- 워크로드를 먼저 정의합니다: Frontend Code·장기 Agent·멀티모달·중국어 생성 중 어떤 축이 SLA에 해당하는지 확정합니다.
- 독립 벤치마크를 교차 확인합니다: Alibaba 자체 수치와 Arena.ai·Artificial Analysis·Vals AI 재측정을 구분해 기록합니다.
- API vs 자체 TCO를 산출합니다: Qwen3.8-Max $2/$6과 K3 $3/$15, DeepSeek 오프피크 요금을 월간 토큰량·캐시 히트율로 비교합니다.
- 오픈 웨이트 LICENSE를 공개일에 확인합니다: Max급 첫 공개이므로 상업 재배포·파인튜닝 조항을 법무와 검토합니다.
- OpenRouter·Vercel AI Gateway 라우팅을 평가합니다: Vercel은 8월 2일
alibaba/qwen3.8-max를 provider pricing 그대로 추가했습니다. OpenRouter 멀티 모델 게이트웨이 Fallback 설정도 병행 검토합니다. - Agent 오케스트레이션과 추론을 분리합니다: QwenWork·Kimi Work 같은 플랫폼 레이어와 raw API를 별도 평가하고, macOS/iOS 네이티브 빌드는 클라우드 LLM과 분리합니다.
SECTION 05 API 요금·인용 가능 데이터·1차 출처
| 항목 | 가격 | 비교 |
|---|---|---|
| 입력 | $2.00 | K3 $3.00 대비 33% 저렴 |
| 출력 | $6.00 | K3 $15.00 대비 60% 저렴, Sol $30 대비 80% 저렴 |
- 파라미터: 2.4T 총량, 95B 활성/토큰, Sparse MoE + 하이브리드 어텐션
- 컨텍스트: 1,048,576 토큰(입력 991K, 출력 131K, 추론 262K)
- Arena: Text 5위, Vision 2위, Frontend Code 4위(1,668점)
- PaperBench: 93.0%(Alibaba 자체, 2026.8.3)
- 오픈 웨이트: 8월 10일 전후 Hugging Face·ModelScope(Qwen3.8-27B 동시)
- 접점: QwenCloud
qwen3.8-max, Alibaba Cloud Model Studio, QwenWork 베타 - K3 대비: Frontend Code 1,668 vs 1,676(8점 차), API 출력 60% 저렴, 웨이트 공개 2주 지연
공식·독립 평가 참조——업스트림 갱신 후 링크를 재확인하세요:
Alibaba Cloud — Qwen3.8-Max 공식 보도자료(2026.8.3)
Alibaba Cloud Model Studio — Qwen API 문서
Arena.ai — Text·Vision·Frontend Code 리더보드
Qwen3.8-Max는 API 가격과 Vision Arena 2위로 멀티모달·Agent 추론 경제성을 바꾸지만, Xcode 프로젝트 컴파일, iOS 바이너리 서명, Metal 셰이더 디버깅까지는 담당하지 않습니다. 가상화 macOS 스택은 EULA 리스크와 측정 가능한 오버헤드를 동반합니다. 실전 프로덕션 패턴은 Qwen3.8-Max API(또는 8월 10일 이후 자체 엔드포인트)로 100만 토큰 추론·에이전트 오케스트레이션을 수행하고 VPSNIX M4/M4 Pro 물리 노드에서 Apple Silicon 네이티브 빌드를 실행하는 이중 스택입니다——100% Apple 하드, full root, 가상화 택스 제로, 일·월 탄력 과금. 요금을 확인하고 장시간 Agent는 규정 준수 물리 인프라에 탑재하세요.
SECTION 06 자주 묻는 질문 FAQ
Qwen3.8-Max는 언제 출시되었나요?
2026년 8월 3일 정식 출시(GA)되었습니다. 7월 WAIC에서 Qwen3.8-Max-Preview로 API 선행 가동되었으나, 벤치마크와 전체 기술 문서는 8월 3일과 함께 공개되었습니다.
Qwen3.8-Max 오픈 웨이트는 언제 공개되나요?
Alibaba는 「다음 주」 Hugging Face·ModelScope 배포를 예고했습니다(8월 10일 전후). Max급 Qwen 역사상 첫 오픈 웨이트이며, Qwen3.8-27B도 동시 공개 예정입니다. LICENSE 전문은 공개일에 확인해야 합니다.
Qwen3.8-Max와 Kimi K3 중 어느 쪽이 더 강한가요?
워크로드에 따라 다릅니다. Frontend Code Arena에서 K3(Max) 1,676점이 Qwen3.8-Max 1,668점보다 앞섭니다. Vision Arena에서는 Qwen3.8-Max 2위로 K3보다 유리합니다. API 요금은 Qwen3.8-Max($2/$6)가 K3($3/$15)보다 33~60% 저렴하고, K3는 이미 7월 27일 오픈 웨이트를 공개했습니다.
Qwen3.8-Max API 요금은 얼마인가요?
입력 $2.00/100만 토큰, 출력 $6.00/100만 토큰입니다(QwenCloud·Alibaba Cloud Model Studio, 2026.8.3 기준). Kimi K3·GPT-5.6 Sol 대비 출력 비용이 현저히 낮습니다.
Arena에서 Qwen3.8-Max 순위는 몇 위인가요?
Text Arena 5위, Vision Arena 2위(Claude Fable 5에만 뒤짐), Frontend Code Arena 4위(1,668점)입니다. Preview 단계에서는 벤치마크가 없었고, GA와 함께 독립 리더보드 수치가 처음 공개되었습니다.
Qwen3.8-Max는 오픈소스인가요?
아직 API만 가동 중이며, 오픈 웨이트는 8월 10일 전후 예정입니다. Alibaba 공식 표현은 open weights이지 open source가 아닙니다. 학습 코드·데이터셋 포함 여부는 웨이트 공개일 LICENSE를 확인해야 합니다.