3개월의 대기 끝에 DeepSeek V4 풀버전(GA)이 2026년 7월 20일 공식 출시되었습니다. 2026년 오픈소스 LLM을 비교·선정 중이거나 deepseek-chat 엔드포인트 중단을 우려하는 AI 엔지니어·기술 리더를 위해, 기술 아키텍처, 벤치마크, 피크/오프피크 과금, GPT-5.6 / Claude Fable 5 횡단 비교, 7월 24일 API 마이그레이션을 5개 축으로 정리합니다. 핵심 결론: V4는 아직 폐쇄형 플래그십을 이기지 못하지만, 1/10~1/100 비용으로 오픈소스 최강 성능을 제공합니다. 피크 과금은 복잡해졌으나 오프피크 출력 $0.87/M은 여전히 압도적입니다.
SECTION 01 DeepSeek V4 GA 출시, 개발자가 경계해야 할 3가지 리스크
- 구 엔드포인트 영구 종료:
deepseek-chat과deepseek-reasoner는 2026년 7월 24일 23:59(베이징 시간)에 접근이 차단되며, 미이전 프로덕션 서비스는 즉시 중단됩니다. - 최초 피크/오프피크 과금: 평일 09:00–12:00, 14:00–18:00(베이징 시간) 요율 2배. 24/7 파이프라인을 스케줄링하지 않으면 청구서가 예상을 초과할 수 있습니다.
- 클라우드 API는 네이티브 빌드 체인을 대체할 수 없음: V4-Pro가 아무리 강력해도 가상화 macOS에서 Xcode 서명·Metal 디버깅을 안정적으로 돌릴 수 없습니다. Mac Mini M4 렌탈 vs 구매 비용 비교에서 논의한 물리 노드 요구와 상호 보완적입니다.
- 프리뷰 vs 풀버전 경계: GA는 Agent·수학 추론·코드 생성을 강화했으나 아키텍처는 동일합니다. 4월 프리뷰를 재평가하기보다 신규 요금·벤치마크 기준으로 선택하세요.
SECTION 02 프리뷰에서 풀버전까지: DeepSeek V4 출시 타임라인
| 일자 | 이벤트 |
|---|---|
| 2026-04-24 | V4 프리뷰 공개 + MIT 오픈소스(V4-Pro 1.6T, V4-Flash 284B) |
| 2026-05 | 프로덕션 튜닝 버전 출시, API 정식 가용 |
| 2026-06 | V4-Pro 출력 단가 75% 인하, $0.87/M tokens 영구 적용 |
| 2026-06-29 | 전체 API 사용자 이메일 공지, 7월 중순 GA·피크 과금 최초 공개 |
| 2026-07-19 | 다수 개발자 GA 그레이 테스트 자격, 언론 「풀버전 내일 공개」 보도 |
| 2026-07-20 | GA 정식 출시 |
| 2026-07-24 | deepseek-chat / deepseek-reasoner 영구 종료 |
한 줄 요약: 프리뷰만으로도 강력했으나, 풀버전은 Agent·수학·코드 생성을 추가 개선하고 정식 상용 과금 체계를 갖추었습니다 — 「거의 무료」에서 규율 있는 상용 운영으로 넘어선 전환점입니다.
SECTION 03 V4-Pro / V4-Flash: CSA+HCA 아키텍처와 3가지 추론 모드
| 항목 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조(1.6T) | 2840억(284B) |
| 토큰당 활성 파라미터 | 490억(49B) | 130억(13B) |
| Transformer 레이어 | 61층 | 43층 |
| 컨텍스트 윈도우 | 1,000,000 tokens | 1,000,000 tokens |
| 최대 출력 | 384K tokens | 384K tokens |
| 정밀도 | FP4(전문가) + FP8(기타) | FP4 + FP8 혼합 |
| 사전학습 데이터 | 33T+ tokens | 32T+ tokens |
| 라이선스 | MIT | MIT |
DeepSeek V4는 V2/V3 시대 MLA(Multi-head Latent Attention)를 버리고 Compressed Sparse Attention(CSA)과 Heavily Compressed Attention(HCA) 하이브리드를 채택했습니다. CSA는 Softmax 게이트 풀링으로 KV 시퀀스를 4배 압축하고, FP4 「라이트닝 인덱서」로 top-k 희소 선택(Pro top-1024, Flash top-512)을 수행하며 최근 128 token 슬라이딩 윈도우를 유지합니다. HCA는 token을 128배 압축해 글로벌 밀집 어텐션을 실행하며 CSA와 상호 보완합니다. 1M 컨텍스트에서 V3.2 대비 추론 FLOPs 27%, KV Cache 메모리는 V3.2의 10%(Flash 7%)입니다.
또한 manifold-constrained Hyper-Connections(mHC)가 4채널 잔차 흐름과 이중 확률 행렬 제약으로 61층 심층 네트워크 신호 전파를 안정화합니다. 학습에는 AdamW 대신 Muon 옵티마이저(Newton–Schulz 직교화 그래디언트)를 사용해 수렴이 빠르고 안정적입니다.
| 모드 | 특징 | 적합 시나리오 |
|---|---|---|
| Non-think | 사고 체인 없음, 최고속 응답 | 단순 Q&A, 라우팅 |
| Think High | 명시적 추론(사고 태그) | 중간 복잡도 작업, 코드 디버깅 |
| Think Max | 최대 추론 강도, 384K+ 컨텍스트 권장 | 고난도 수학, 장체인 Agent |
공식 권장 샘플링: temperature=1.0, top_p=1.0(전 모드 공통).
SECTION 04 벤치마크: 오픈소스 최고 80.6%와 가성비
| 벤치마크 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 96.0% | 별도 미공개 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified는 실제 GitHub 저장소 버그 수정을 측정하며, 80.6%는 현재 오픈소스 최고로 Gemini 3.1 Pro와 동률입니다. Artificial Analysis에 따르면 Strategy & Ops 지수 작업에서 Claude Fable 5는 1회 $3.48에 50점, V4-Pro는 $0.03에 38점 — 비용은 Fable 5 대비 116배 저렴하고 점수 차는 약 12점(31%)입니다.
SECTION 05 GPT-5.6 / Claude Fable 5 비교와 피크/오프피크 요금표
| 축 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 오픈소스 / 셀프호스팅 | MIT | 폐쇄형 | 폐쇄형 |
| 컨텍스트 | 1M tokens | 미공개 | 1M tokens |
| API 출력(오프피크) | $0.87/M | ~$15/M | $50/M |
| API 출력(피크) | $1.74/M | — | — |
| 코드 능력 | 매우 높음(Fable 5 근접) | 매우 높음 | 최상 |
| 데이터 프라이버시 | 프라이빗 배포 가능 | 불가 | 불가 |
시나리오별 선택: 예산·고빈도 호출·프라이빗 배포 → V4-Pro / V4-Flash. 코드 성능 최우선·비용 무관 → Claude Fable 5. 복잡 알고리즘+수학 → GPT-5.6 Sol / Ultra. 초대규모 로그 → V4-Flash(캐시 히트 입력 $0.0028/M). Kimi K3 심층 리뷰와 함께 보면 K3는 파라미터가 더 크지만, V4는 오프피크 단가가 낮고 MIT 가중치를 이미 활용할 수 있습니다.
| 모델 | 과금 항목 | 오프피크 | 피크 |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | ¥0.025 / $0.0035 / 1M | 2배 |
| V4-Pro | 입력(캐시 미스) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 / 1M |
| V4-Pro | 출력 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 / 1M |
| V4-Flash | 입력(캐시 히트) | ¥0.02 / $0.0028 / 1M | 2배 |
| V4-Flash | 입력(캐시 미스) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 / 1M |
| V4-Flash | 출력 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 / 1M |
비용 절감: 비실시간 작업은 18:00 이후 또는 9:00 이전에 실행. Prompt Cache로 히트율 상승. 경량 라우팅은 V4-Flash, 복잡 추론은 V4-Pro. 피크 시간에도 V4-Pro 출력 $1.74/M은 Claude Opus 4.8($15/M)보다 8.6배 저렴합니다.
SECTION 06 API 마이그레이션: 7월 24일 마감 6단계 실전 가이드
중요: 구 모델명 deepseek-chat, deepseek-reasoner는 2026년 7월 24일 15:59 UTC(베이징 7월 24일 23:59)에 영구 중단됩니다.
| 구 모델 | 신 모델 | 비고 |
|---|---|---|
deepseek-chat |
deepseek-v4-flash(비사고 모드) |
고속, 경량 작업 |
deepseek-reasoner |
deepseek-v4-flash(사고 모드) |
또는 deepseek-v4-pro로 업그레이드 |
- 구 모델명 전체 검색: 코드 저장소, CI 설정, 환경 변수에서
deepseek-chat,deepseek-reasoner를 찾습니다. - 대상 모델 결정: 경량 대화 →
deepseek-v4-flash. 복잡 추론 →deepseek-v4-pro. - OpenAI SDK 호출 업데이트:
model만 변경,base_url은https://api.deepseek.com유지. - 사고 모드 설정(선택):
extra_body로 thinking 활성화, 구deepseek-reasoner동작 재현. - Staging 부하 테스트: 지연, token 과금, 피크 시간대 청구 검증.
- 7월 24일 전 카나리 배포: 프로덕션 전환 후 오류율 모니터링. DeepSeek는 요금 변경 24시간 전 이메일 통지를 약속합니다.
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4는 OpenAI ChatCompletions와 Anthropic Messages 형식을 모두 지원합니다. Anthropic SDK 사용 시에도 base_url은 그대로 두고 model만 deepseek-v4-pro로 업데이트하면 됩니다.
SECTION 07 인용 가능 데이터와 권위 출처
- KV Cache 효율: 1M 컨텍스트에서 V3.2 대비 10% 메모리(Flash 7%)
- 추론 FLOPs: 1M 시나리오 V3.2 대비 27%
- 가성비: V4-Pro 1회 $0.03 vs Fable 5 $3.48, 116배 격차
- 피크에도 저렴: 피크 출력 $1.74/M, Opus 4.8의 1/8.6
- 마이그레이션 마감: 2026-07-24 23:59 베이징 시간
- 권장 샘플링: temperature=1.0, top_p=1.0
공식·제3자 참고 출처(출시 후 링크를 다시 확인하세요):
arXiv:2606.19348 — DeepSeek V4 기술 논문
Artificial Analysis — 모델 가성비 평가 데이터
DeepSeek V4 GA는 2026년 오픈소스 LLM 분야 최중요 마일스톤 중 하나입니다. 가치는 Claude Fable 5나 GPT-5.6을 이기는 데 있지 않고, 극저비용으로 오픈소스 최강 성능을 제공하는 데 있습니다. 그러나 클라우드 LLM은 Xcode 컴파일, Metal 디버깅, iOS 인증서 체인을 대체할 수 없습니다. 가상화 macOS는 EULA 리스크와 20–40% 성능 손실을 동반합니다. 실전 조합은 V4 API로 장컨텍스트 추론·Agent 오케스트레이션을 담당하고, VPSNIX M4/M4 Pro 물리 노드에서 Xcode/Metal 네이티브 빌드와 7×24 운영을 수행하는 이중 스택입니다 — 100% 정품 하드웨어, 완전 Root 권한, Hypervisor 오버헤드 없음. 견적은 요금 페이지에서 확인하세요. Kimi K3 심층 리뷰를 읽었다면, 단일 API 벤더 요금 변동에 베팅하기보다 컴플라이언스 물리 환경에 연산을 고정하는 편이 낫습니다.
SECTION 08 자주 묻는 질문 FAQ
풀버전 GA와 프리뷰의 차이는?
아키텍처는 동일합니다. GA는 Agent·수학·코드 생성을 강화하고 피크 과금을 도입했습니다. 구 엔드포인트 deepseek-chat / deepseek-reasoner는 7월 24일 종료됩니다.
피크 시간대는 언제인가요?
평일 베이징 시간 09:00–12:00, 14:00–18:00에 요율 2배. 그 외는 오프피크 단가입니다.
V4-Pro와 V4-Flash 중 무엇을 선택해야 하나요?
Flash는 경량 라우팅·고빈도 호출(출력 $0.28/M). Pro는 복잡 추론·코드(출력 $0.87/M, SWE-bench Verified 80.6%).
DeepSeek V4를 셀프호스팅할 수 있나요?
MIT 라이선스로 가능합니다. V4-Pro 1.6T는 대규모 GPU 클러스터가 필요하며, 대부분 팀은 API가 더 경제적입니다.