DeepSeek, Qwen, GLM 청구서를 보는 팀은 8월 둘째 주에 세 가지를 동시에 확인해야 했습니다. DeepSeek는 피크 캐시 히트 입력을 최대 1,100% 올렸고, Alibaba는 한 번도 공개하지 않았던 2.4조 파라미터 플래그십을 오픈 웨이트로 풀었으며, 智谱 GLM-5.3은 743B 베이스를 그대로 두고 후학습 RL만으로 Terminal-Bench 3.0을 4.6%에서 28.3%로 끌어올렸습니다. 최저가 경쟁이 아니라 가격 결정력 경쟁으로 축이 옮긴 것입니다. 본문은 타임라인, 위안 단가, 세 전략, 가로 비교, 미검증 주장, 6단계 점검으로 숫자를 고정합니다.
SECTION 01 DeepSeek 1,100% 인상을 인용하기 전에 구분할 4가지
- 헤드라인은 한 줄이지 청구서 전체가 아닙니다: 「11배」, 「1,100% 초과」, 「350%」는 모두 맞습니다. 각각 피크 캐시 히트 입력, 출력, 캐시 미스 입력에 대응합니다. 실제 청구를 움직이는 쪽은 거의 0에 가깝던 캐시 히트보다 출력과 캐시 미스입니다.
- 피크는 베이징 시간입니다: 오전 9시–정오, 오후 2시–6시. 그 밖은 오프피크이며 피크의 절반입니다. 공지는 부하를 옮기라는 신호입니다.
- 오픈 웨이트 ≠ Apache 2.0: Qwen3.8-Max는 커스텀 라이선스입니다. 12개월 창에서 Model-as-a-Service 또는 AI Work Assistant 매출이 5,000만 달러를 넘으면 별도 상업 계약이 필요합니다. 미국·EU·영국·한국 사용자가 가중치를 받을 수 없다는 주장은 거짓입니다.
- GLM-5.3은 새 베이스가 아닙니다: 파라미터 743B는 GLM-5.2와 같습니다. 상승분은 스케일된 후학습 RL입니다. 점수는 제조사 자가 보고이며 독립 재실행은 아직 공개되지 않았습니다. 선행 제품 노트는 DeepSeek V4 GA와 피크밸리 요금, Qwen3.8-Max 출시 브리프를 참고하세요.
SECTION 02 타임라인: 무엇이 출시됐고 요금은 언제 바뀌었나
| 날짜 | 사건 |
|---|---|
| 2026년 7월 16일 | Moonshot AI가 Kimi K3(2.8T 파라미터)를 오픈 웨이트로 공개, 미국 안보 검토를 유발 |
| 2026년 7월 30일 | OpenAI가 GPT-5.6 Luna를 80% 인하 |
| 2026년 8월 2–3일 | Alibaba가 Qwen3.8-Max를 프리뷰한 뒤 호스티드 API로 출시 |
| 2026년 8월 6–7일 | OpenAI가 Luna를 무료 기본값으로 두고 텍스트 채팅을 무제한으로 전환 |
| 2026년 8월 10일 | Meta가 Muse Glimmer(30B, Apache 2.0)를 공개하고 플래그십 Muse Spark 1.2 오픈 웨이트를 예고 |
| 2026년 8월 12일 | Alibaba가 Qwen3.8-2.4T-A95B를 Hugging Face / ModelScope에 게시. xAI가 Grok 4.6을 출시 |
| 2026년 8월 13일 | DeepSeek-V4-Pro GA, 8월 17일 발효 인상을 공지. Google이 할인 Gemini 3.7 Flash를 출시 |
| 2026년 8월 14일 | 智谱가 GLM-5.3을 출시. GLM-5.2의 743B 베이스를 재사용 |
| 2026년 8월 17일 00:00 베이징 | DeepSeek 신규 요금 발효 |
거리를 두고 보면, 중국 랩이 가격을 올리고 플래그십 가중치를 여는 동안 미국 랩은 소비자 층에서 가격을 깎고 무료로 갔습니다. 같은 싸움의 반대편입니다. OpenAI 인하는 GPT-5.6 Luna / Terra / Sol 요금 재조정 노트에 정리돼 있습니다.
SECTION 03 숫자: DeepSeek 요금표, Qwen 스펙, GLM은 후학습만
신규 DeepSeek 단가는 베이징 시간 8월 17일 00:00에 발효됩니다. 피크는 베이징 시간 오전 9시–정오, 오후 2시–6시입니다. 아래 수치는 100만 토큰당 위안이며 공식 공지와 복수 보도를 교차 확인했습니다.
| 과금 항목 | 기존가 | 신규 오프피크 | 신규 피크 | 피크 인상폭 |
|---|---|---|---|---|
| V4-Flash 캐시 히트(입력) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash 캐시 미스(입력) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash 출력 | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro 캐시 히트(입력) | ¥0.025 | ¥0.15 | ¥0.30 | ~1,100% |
| V4-Pro 캐시 미스(입력) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro 출력 | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
1,100%는 피크 캐시 히트 입력에만 해당합니다. 거의 공짜에 가깝던 항목입니다. 실제 청구의 대부분을 차지하는 출력은 350% 올랐습니다. 오프피크·캐시 히트 절반의 고부하를 독립 모델링하면 약 1.8배에 가깝습니다.
| 스펙 | 내용 |
|---|---|
| 파라미터 | 총 2.4T, 토큰당 활성 95B (MoE, 전문가 512, 라우팅 10 + 공유 1) |
| 컨텍스트 창 | 네이티브 262,144 토큰(오픈 체크포인트), 약 1.01M까지 확장. 호스티드 Max 기본값은 1M |
| 출시 리듬 | 8월 2일 프리뷰 → 8월 3일 API 가동 → 8월 12일 오픈 웨이트 |
| API 요금(국제) | 입력 $2/M, 출력 $6/M |
| 라이선스 | Apache 2.0이 아님 — Qwen3.8-Max 커스텀 라이선스 |
| 의미 | Alibaba가 Max급 플래그십을 오픈 웨이트로 푼 첫 사례. Qwen3.5 / 3.6 / 3.7 Max는 API 전용이었습니다 |
| 벤치마크 | GLM-5.2 | GLM-5.3 | 변화 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
수치는 智谱 자체 발표입니다. 제3자 독립 재실행은 아직 없습니다. GLM-5.3은 Terminal-Bench 3.0에서 GPT-5.6 Sol(34.6%), Claude Fable 5(33.7%)에 뒤집니다. 오픈 웨이트 상위권이지 프론티어 단독 승리가 아닙니다.
SECTION 04 세 전략: 시간대 요금, 커스텀 라이선스, 후학습 스케일
DeepSeek: 전략 전환이 아니라 용량 문제입니다
「중국에서 가장 싸던 모델이 마진 압박에 굴복했다」는 읽기는 쉽습니다. 요금표 구조는 반대에 가깝습니다. GPU 공급이 따라갈 때는 항상 싼 정액이 획득 도구였습니다. 사용량은 지수적으로 늘고 용량은 그렇지 않자, 희소성을 가격에 명시해야 했습니다. 「더 유연한 워크로드 스케줄링을 권장한다」는 기업 문구의 실체는 「피크 연산이 부족하니 부하를 직접 옮기라」입니다.
해외 보도가 자주 빠뜨리는 한 줄이 있습니다. 피크 시간대에는 DeepSeek 공식 API가 GMI Cloud, Novita 등 일부 제3자 리셀러보다 비쌉니다. 이들은 여전히 V4 Pro를 신규 공식 피크보다 낮게 게시합니다. 「공식 API가 항상 가장 싼 DeepSeek 경로」라는 전제는 처음 깨졌습니다.
Alibaba: 가중치는 마인드셰어, 라이선스는 매출 천장
Alibaba는 동시에 두 가지를 했습니다. 2.4T 체크포인트 전체를 무료 다운로드로 풀었습니다. 동시에 소형 Qwen에 쓰던 Apache 2.0이 아닌 커스텀 라이선스를 붙였습니다. 연속 12개월 창에서 Model-as-a-Service 또는 AI Work Assistant 매출이 5,000만 달러를 넘으면 별도 상업 라이선스를 협상해야 하고, 월간 활성 사용자 1억 이상 또는 월 매출 2,000만 달러 이상 제품은 모델명을 눈에 띄게 표시해야 합니다.
개발자, 특히 해외 개발자에게 가중치를 줘 점유를 가져갑니다. 그 위에 경쟁 추론 사업을 세울 수 있는 소수 기업에는 레버리지를 남깁니다. Meta Muse Glimmer의 제한 없는 Apache 2.0과는 다른 베팅입니다. 라이선스가 미국·EU·영국·한국 다운로드를 금지한다는 주장은 거짓입니다. 공개 문안에 지리적 조항은 없습니다.
GLM-5.3: 새 베이스가 아니라 방법이 본론입니다
베이스는 GLM-5.2와 같은 743B입니다. 재학습은 없습니다. Terminal-Bench 3.0에서 약 6배(4.6% → 28.3%)는 후학습 강화 학습 환경을 스케일한 결과입니다. 사전학습 스케일링 법칙의 수익이 줄어들수록, 후학습 RL은 파운데이션을 다시 훈련하는 것보다 비용 하한이 훨씬 낮은 독립 레버가 됩니다. OpenAI급 연산을 갖지 못한 중위 랩도 에이전트·코딩 벤치 격차를 좁힐 수 있습니다.
V4-Pro per 1M tokens CNY (Beijing peak 09-12 / 14-18)
off-peak cache-hit 0.15 miss 4.5 out 13.5
peak cache-hit 0.30 miss 9.0 out 27.0
headline ~1100% = peak cache-hit input only
SECTION 05 가로 비교: DeepSeek는 여전히 가장 싼 프론티어급인가
| 모델 | 입력 | 출력 | 오픈 웨이트 |
|---|---|---|---|
| DeepSeek V4-Pro (피크) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | 아니오 |
| DeepSeek V4-Pro (오프피크) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | 아니오 |
| Qwen3.8-Max (국제 API) | $2.00 | $6.00 | 예 (커스텀 라이선스) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | 아니오 |
| Claude Opus 5 (Alibaba 비율 환산) | ~$5.00 | ~$25.00 | 아니오 |
위안–달러는 약 ¥7.15/$1, 근사치입니다. 오프피크 V4-Pro는 여전히 Claude Opus 5보다 훨씬 낮지만, 단독 최저가는 아닙니다. Qwen3.8-Max 국제 요금과 OpenAI Luna 모두 DeepSeek 오프피크를 최소 한 차원에서 밑돕니다. 「중국 모델 = 가장 싼 모델」은 2025년과 2026년 초에는 성립했습니다. 더 이상 안전한 전제가 아닙니다.
SECTION 06 논쟁 중이거나 아직 검증되지 않은 주장
- 1,100% 헤드라인은 정확하지만 맥락 없이는 오도합니다. 피크 캐시 히트 입력에만 해당합니다. 실제 청구의 대부분인 출력은 350% 올랐습니다.
- Qwen3.8-Max가 Alibaba 자체 Zhenwu M890 칩과 「Pangu AL128」 슈퍼노드에서 돈다는 주장은 여러 중국 금융 매체가 전했으나 Alibaba 기술 문서나 제3자 벤치로 독립 확인되지 않았습니다. 벤더 인접·미검증 보도로 다루세요.
- GLM-5.3이 Cursor에서 「심각한 취약점」을 발견했다는 보고는 VentureBeat와 智谱 자체 공개에 의존합니다. 기술 세부는 공개되지 않았습니다. 벤더 출처이지 독립 감사가 아닙니다.
- 중국 상무부가 AI / 반도체 기술에 대한 보복 수출 통제를 준비 중일 수 있다는 보도는 추측이며 미확인 매체 취재에 의존합니다. 공식 발표가 아닙니다.
SECTION 07 왜 중요한가: 동시에 돌아가는 두 개의 가격전
지난 한 달 중국 상위 랩의 출시 속도는 국내 금융 매체가 「주 3회 모델 업데이트」라고 부를 정도입니다. DeepSeek, Alibaba, 智谱 아래에는 Moonshot Kimi K3(7월 16일 오픈 웨이트, 2.8T)와 MiniMax H3가 있습니다. 중국어 보도는 오픈 웨이트 공개가 산업 전체의 재가격을 강제한다고 읽으며, 영문 제품 노트보다 공세적입니다. Kimi K3 배경은 Kimi K3 전체 오픈 웨이트 공개를 보세요.
미국 랩은 소비자 층에서 반대 수를 둡니다. OpenAI는 7월 30일 최저 티어를 80% 깎고 일주일 뒤 그 모델을 무료·무제한으로 만들었습니다. Google은 8월 13일 코딩 특화 모델을 3주 전 전작의 절반 가격으로 냈습니다. 중국 랩은 플래그십을 오픈 웨이트로 풀고 연산이 부족한 상단에 계층형 고가를 넣습니다. 미국 랩은 소비자 끝에서 무료와 저가로 달립니다. 둘 다 실재하며 퍼널의 다른 구간을 최적화합니다.
지정학 층도 조심스럽게 이름을 붙여야 합니다. Moonshot Kimi K3는 이미 미국 안보 검토를 받았습니다. 일부 분석은 Alibaba가 이 창에 2.4T 플래그십을 연 이유를, 규제 강화 전에 해외 마인드셰어와 「기술 동등」 서사를 고정하려는 수로 읽습니다. 확인된 사실이 아니라 정보에 기반한 해석입니다. 영문 테크 언론이 개별 제품 뉴스로만 다루면 빠지기 쉽습니다.
SECTION 08 6단계: 인상을 자사 청구서에 대입하는 방법
- 헤드라인을 곱하기 전에 과금 줄을 분리합니다: 캐시 히트 입력, 캐시 미스 입력, 출력은 다른 항목입니다. 1,100%를 월 전체에 적용하지 마세요.
- 트래픽을 베이징 피크 창에 매핑합니다: 오전 9시–정오, 오후 2시–6시(베이징)가 피크입니다. 배치 평가, 오프라인 증류, 야간 에이전트 리플레이는 오프피크로 둡니다.
- 실제 캐시 히트율로 추정합니다: 캐시 히트가 높고 대부분이 오프피크인 고부하 사용자는 약 1.8배로 모델링된 바 있습니다. 헤드라인에 가까워지는 쪽은 피크 + 낮은 히트율입니다.
- 공지 스레드가 아니라 Qwen3.8-Max License 파일을 읽습니다: 개인·내부 사용은 대체로 영향이 없습니다. 연속 12개월 MaaS / AI Work Assistant 매출 5,000만 달러 초과는 별도 상업 라이선스가 필요합니다. MAU 1억 또는 월 매출 2,000만 달러는 모델명 눈에 띄는 표시가 필요합니다. 지리적 금지는 없습니다.
- GLM-5.3 제조사 점수와 제3자 재실행을 분리합니다: Terminal-Bench 3.0의 4.6% → 28.3%는 자가 보고입니다. 독립 재실행이 나오기 전에 「프론티어 승리」로 쓰지 마세요.
- 미검증 주장은 별도 장부에 둡니다: Zhenwu M890 / Pangu AL128, Cursor 취약점, 수출 통제 소문은 확정 사실이 아닙니다. 출구와 Root를 통제해야 하는 민감 평가·오프피크 실험은 공유 클라우드 세션이 아니라 격리된 물리 노드에 둡니다.
SECTION 09 인용 가능한 수치와 1차 출처
- V4-Pro 피크 캐시 히트 입력: ¥0.025 → ¥0.30, 약 1,100%. 출력 ¥6.0 → ¥27.0, 350%
- Qwen3.8-2.4T-A95B: 총 2.4T / 활성 95B. 네이티브 262K, 확장 약 1.01M. 국제 API $2 / $6
- GLM-5.3 Terminal-Bench 3.0: 4.6% → 28.3%(+23.7), 동일 743B 베이스, 재학습 없음. 제조사 자가 보고
- 라이선스 문턱: 12개월 MaaS 또는 AI Work Assistant 5,000만 달러는 별도 라이선스. MAU 1억 또는 월 매출 2,000만 달러는 눈에 띄는 모델명 표기
아래는 공식·제3자 입구입니다. 재게시 전에 최신 공식 요금과 라이선스 조항을 다시 여세요. 위에서 미검증으로 표시한 항목(국산 칩 주장, Cursor 취약점 보고, 수출 통제 소문)은 독립 확인되지 않았습니다.
공식 / 저장소 출처:
DeepSeek API Docs — DeepSeek-V4-Pro GA Release (pricing update)
Hugging Face — Qwen/Qwen3.8-2.4T-A95B
Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities
제3자 보도:
21jingji — DeepSeek 피크/오프피크 요금 발효, 피크 최대 1,100% 인상
VentureBeat — GLM-5.3 and the reported Cursor vulnerability
공유 API가 시간대 요금으로 바뀌면 캐시 히트율과 출구 격리가 청구 변수가 됩니다. 평가, 증류, 24시간 에이전트를 한 세션에 쌓으면 비용과 출구 정책을 동시에 통제하기 어렵습니다. 제로 손실 네이티브 연산, 안정적 iOS CI/CD, AI Agent 7×24 자동화가 필요한 프로덕션에서는 VPSNIX 클라우드 물리 노드가 보통 더 나은 선택입니다. 100% Apple 정품 물리기, 완전 Root, Hypervisor 손실 없음, 일·주·월 유연 주문으로 오프피크 실험과 프로덕션 파이프라인을 나눌 수 있습니다. Mac mini M4 클라우드 렌탈 완전 가이드와 요금 페이지로 방안을 검토하세요.
SECTION 10 자주 묻는 질문 FAQ
인상 후에도 DeepSeek가 GPT-5.6이나 Claude보다 싼가요?
오프피크는 여전히 Claude Opus 5보다 쌉니다. 다만 전체에서 단독 최저가는 아닙니다. OpenAI GPT-5.6 Luna(100만 토큰당 $0.20 / $1.20)와 Alibaba Qwen3.8-Max 국제 요금($2 / $6)은 DeepSeek 신규 오프피크를 최소 한 차원에서 밑돕니다. 프론티어급으로는 여전히 상대적으로 싸지만, 더 이상 「무조건 가장 싼 모델」은 아닙니다.
Alibaba Qwen3.8-Max 오픈 웨이트를 상업 제품에 무료로 쓸 수 있나요?
대부분의 경우 가능합니다. 개인 프로젝트와 기업 내부 사용은 영향이 없습니다. 걸리는 지점은 Model-as-a-Service 또는 AI Work Assistant 사업이 연속 12개월 창에서 5,000만 달러를 넘긴 경우입니다. 그 구간은 Alibaba와 별도 상업 라이선스가 필요합니다.
Qwen3.8-Max는 미국·EU·영국 사용자에게 금지되거나 제한되나요?
아닙니다. 온라인에 퍼진 그 주장은 거짓입니다. 공개 라이선스에 지리적 제한은 없습니다. 제한은 매출 기준이며, 본인이나 사용자가 어디에 있는지가 아닙니다.
GLM-5.3과 GLM-5.2의 실제 차이는 무엇인가요?
베이스 모델 수준에서는 없습니다. 둘 다 7430억 파라미터 파운데이션을 씁니다. 성능 상승(Terminal-Bench 3.0에서 약 6배)은 전부 후학습 강화 학습을 스케일한 결과이며 베이스 재학습은 없습니다.
Meta가 소형 Muse Glimmer가 아니라 플래그십도 정말 오픈하나요?
아직 아닙니다. Muse Glimmer는 30B 증류 모델이지 Meta의 실제 플래그십이 아닙니다. Mark Zuckerberg는 더 큰 폐쇄형 Muse Spark 1.2의 오픈 웨이트가 「곧」 나온다고 말했고, 실현되면 미국 플래그십급 최초 공개가 됩니다. 작성 시점 기준으로 그 공개는 일어나지 않았습니다. 확인된 사실이 아니라 표명된 의도로 다루세요.