2026년 7월 31일 DeepSeek이 V4-Flash를 공식판(build 0731)으로 승격했습니다. 파라미터 규모는 4월 프리뷰와 동일(284B 총량·13B 활성)하며 후학습만 재실행했지만, Agent 벤치마크에서는 자사 1.6T V4-Pro 프리뷰를 넘어섰고 가격은 Claude Opus 4.8의 대략 36~179분의 1 수준입니다. 본문은 ML 엔지니어와 엔터프라이즈 선정 담당자를 위해 타임라인, 요금 매트릭스, 자체 Harness 프레임워크 논점, Kimi K3·Qwen3.8-Max 횡단 비교를 정리합니다. 결론적으로 V4-Flash-0731은 「충분한 지능+극단적 저가」 전략이며 리더보드 1위 경쟁이 아닙니다. 공식 V4-Pro와 Harness는 아직 미공개이므로 선정 시 점수보다 검증 가능성을 우선해야 합니다.
SECTION 01 V4-Flash 공식판에서 기술 선정자가 놓치기 쉬운 5가지 리스크
- 신규 모델이 아니라 동일 아키텍처의 후학습 갱신: DeepSeek은 0731판이 4월 프리뷰와 파라미터 규모·구조가 완전히 동일함을 명시했습니다. 성능 향상은 「후학습 재실행」에서만 비롯되므로 「크면 강하다」는 전제로 평가하면 결론이 왜곡됩니다.
- Agent 점수는 미공개 Harness에 강하게 의존: Terminal Bench 2.0 82.7점(V4-Pro 프리뷰 67.9 초과)은 DeepSeek 자체 개발·미공개 Harness 「minimal mode」로 측정되었습니다. changelog에서도 「harness 선택에 극도로 민감」하다고 경고하며 Claude Code·Cursor로의 단순 이식은 불가합니다.
- API 전용, 앱·웹 미동기화: 7월 31일 업데이트는 API 공개 베타만 해당합니다. 소비자 앱과 웹 채팅은 구버전입니다. 복수 엔드포인트를 쓰는 팀은 실제 model명을 확인해야 합니다.
- V4-Pro 공식판 일정 미확정: 중국 매체가 8월 10~20일 GA를 보도했으나 DeepSeek 공식은 「가능한 한 빨리」만 언급합니다. 4월 V4 GA 분석에서 논의한 Pro 일정은 미확인으로 취급해야 합니다.
- 실운용 불만과 벤치마크 내러티브의 괴리: 21세기경제보가 인용한 해외 개발자 커뮤니티에서는 입력 캐시 히트율 저하, 안전 분류기 타임아웃이 보고되었습니다. 후학습만으로 해결되지 않는 연산·예산 한계가 남아 있습니다.
SECTION 02 4월 프리뷰에서 7월 공식판까지: 타임라인과 핵심 요금
| 날짜 | 이벤트 |
|---|---|
| 2026-04-24 | V4 프리뷰 공개+MIT 오픈 웨이트: V4-Pro(1.6T/49B 활성), V4-Flash(284B/13B 활성), 모두 1M 컨텍스트 |
| 2026-07-24 | 레거시 별칭 deepseek-chat·deepseek-reasoner 폐지, 전 트래픽 V4 패밀리로 전환 |
| 2026-07-27 | Moonshot AI Kimi K3(2.8T) 전체 웨이트 Hugging Face 공개 — DeepSeek에 직접 경쟁 압력 |
| 2026-07-31 | V4-Flash-0731 공식판 API 공개 베타, 웨이트 동시 공개. changelog에서 자체 Agent 프레임워크 「Harness」 최초 명명 |
| 2026-08-05(집필 시) | V4-Pro 공식판은 「가능한 한 빨리」 유지. 앱·웹은 0731 미반영 |
| 모델 | 상태 | 입력(미스/히트) | 출력 | 라이선스 |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 공식판 | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 프리뷰만 | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 웨이트 공개(7/27) | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| Qwen3.8-Max | API GA(8/2), 웨이트 대기 | $2.00 / ~$0.17-0.25 | $6.00 | 오픈 웨이트 예고 |
요금은 모두 벤더 공시값입니다. DeepSeek은 베이징 시간 9~12시·14~18시 피크 2배 surcharge를 예고했으나 시행일은 미확정입니다. 캐시 히트 입력 단가는 Claude Opus 4.8의 약 179분의 1입니다.
SECTION 03 성능의 원천: 아키텍처, Harness, 육각형 경쟁
기술 보고서 「DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence」에 따르면 0731판에서 계승되는 3가지 설계 변경은 다음과 같습니다.
- 하이브리드 어텐션(DSA): 압축 희소 어텐션(CSA)과 고도 압축 어텐션(HCA) 결합. 장컨텍스트 시 연산·메모리 절감. 공식 수치상 V4-Pro는 1M 토큰 시 FLOPs가 V3.2의 27%, KV Cache 10%.
- 다양체 제약 하이퍼커넥션(mHC): 잔차 연결 개선으로 학습 안정성 향상.
- Muon 옵티마이저: 기존 옵티마이저 대체로 수렴 가속 — 성능 도약의 주원인은 파라미터 확대가 아닌 후학습 품질입니다.
7월 31일 changelog에서 최초 공식 명칭이 등장한 DeepSeek Harness는 Claude Code에 대응하는 자체 Agent 실행 프레임워크입니다. 파일 I/O, 도구 호출, 다단계 엔지니어링을 담당합니다. 지금까지 DeepSeek 모델은 서드파티 Agent 도구에 의존해 왔으나, 공개된 Agent 벤치는 모두 Harness minimal mode(max 추론, top_p=0.95, temperature=1.0)로 측정되었고 프레임워크 자체는 미공개입니다.
| 모델 | 랩 | Intelligence Index | 태스크 평균 비용 |
|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 50 | $0.03 |
| Kimi K3 | Moonshot AI | 57 | $0.86 |
| GPT-5.6 Sol | OpenAI(클로즈드) | V4-Flash보다 9점 이상 높음 | $1.86 |
| Claude Fable 5 | Anthropic(클로즈드) | V4-Flash보다 9점 이상 높음 | $3.15 |
흥미로운 대비: Artificial Analysis 독립 지수에서 V4-Flash 지능 점수는 Kimi K3에 뒤지지만, 태스크 단가는 K3의 약 29분의 1, Claude Fable 5의 약 105분의 1입니다. 이것이 OpenRouter 7월 랭킹에서 V4-Flash 프리뷰가 7주 연속 호출량 1위를 유지한 이유입니다. 중국 개발자 커뮤니티에서는 「斬殺線(zhǎn shā xiàn)」이라 부릅니다 — 충분한 성능과 바닥 가격 조합이 경쟁사 생존선을 그은다는 뜻이며, GPT-5.6 Luna 80% 인하도 같은 압력의 표현으로 읽힙니다.
SECTION 04 V4-Flash-0731 연동과 Agent 비용 관리 7단계
- model명 마이그레이션을 확인합니다: 폐지된
deepseek-chat·deepseek-reasoner를 쓰는 경우deepseek-v4-flash로 전환합니다. OpenAI ChatCompletions 또는 Anthropic 형식 API에서는 코드 변경 없이 0731 공식판을 가리킵니다. - 공식 요금 스냅샷을 고정합니다: 입력 $0.14/$0.0028(미스/히트), 출력 $0.28 per M tokens, 피크 2배 surcharge 예고를 기록합니다. 업스트림 변경은 매우 빠릅니다.
- 토큰 단가가 아닌 태스크 비용으로 시뮬레이션합니다: 전형적 Agent 파이프라인(계획→도구→집계)의 월간 호출량을 추정하고 Kimi K3 $3/$15, Qwen3.8-Max $2/$6와 비교해 Flash의 「약간 낮은 지능 점수」를 감수할 가치가 있는지 판단합니다.
- 벤더 자체 벤치와 제3자 벤치를 분리 기록합니다: SWE-bench Verified 등 광범위한 제3자 벤치는 신뢰도가 높고, Terminal Bench 2.0은 「Harness minimal mode·미공개」로 명시한 뒤 Claude Code·Cursor 독립 재현을 기다립니다.
- 캐시 히트율과 타임아웃을 모니터링합니다: 해외 개발자 보고에 따르면 캐시 히트율 저하와 안전 분류기 타임아웃이 있습니다. 프로덕션에서 cache-hit ratio와 P99 지연을 기록하고 필요 시 Kimi K3나 Qwen3.8-Max로 폴백합니다.
- OpenRouter 멀티 모델 라우팅을 설정합니다: 주 경로는 V4-Flash로 비용 압축, 복잡 추론은 고득점 모델로. OpenRouter 7월 트래픽 데이터로 Flash 실운용 안정성을 검증합니다.
- 고빈도 Agent는 로컬 추론으로 비용을 절감합니다: API 월 청구가 M4 물리 노드 렌탈을 초과하면 시행착오와 중소 모델 추론을 네이티브 Apple Silicon 물리 머신으로 옮기고, 초장 컨텍스트·플래그십 추론만 클라우드 API에 남깁니다. Xcode/iOS CI/CD 빌드 체인은 규정 준수 macOS 하드웨어가 필요합니다.
SECTION 05 인용 가능 데이터와 1차 출처
- V4-Flash-0731 스펙: 284B 총량/13B 활성, 1M 컨텍스트, MIT, 2026-07-31 공식판
- Agent 점수(벤더+Harness): Terminal Bench 2.0 82.7(V4-Pro 프리뷰 67.9)
- 제3자 Intelligence Index: 50점, 태스크 단가 $0.03(Artificial Analysis)
- 요금: 입력 $0.14/$0.0028, 출력 $0.28 per M tokens. 캐시 히트 입력은 Claude Opus 4.8의 약 179분의 1
- 미공개: V4-Pro 공식판, DeepSeek Harness — 공식 「가능한 한 빨리」, 8/10~20은 미확인 루머
- 경쟁 타임라인: Kimi K3 웨이트 7/27, Qwen3.8-Max GA 8/2
공식·독립 평가 참조 — 업스트림 갱신 후 링크를 재확인하세요:
DeepSeek 공식 API 문서 및 changelog
Hugging Face — DeepSeek-V4-Flash 모델 카드
Artificial Analysis — 제3자 Intelligence Index 및 비용 데이터
V4-Flash-0731은 극저 토큰 단가와 실용 수준 Agent 능력으로 오픈 웨이트 LLM 비용 곡선을 바꿨지만, Harness 의존 점수, V4-Pro 지연, 캐시·타임아웃 등 실운용 이슈 — 이 3가지가 대규모 저비용 Agent 편성에는 적합하나 감사 가능한 플래그십 추론에는 부적합한 이유입니다. 어떤 LLM API도 Xcode 컴파일, Metal 디버깅, iOS 서명 체인을 대체하지 못합니다. 가상화 macOS는 EULA 리스크와 20~40% 오버헤드를 동반합니다. 실전 프로덕션 패턴은 V4-Flash 또는 Kimi K3로 100만 토큰 Agent 편성을 수행하고 VPSNIX M4/M4 Pro 물리 노드에서 로컬 Agent 시행, Ollama 추론, iOS CI/CD를 실행하는 이중 스택입니다 — 100% Apple 하드, full root, 가상화 택스 제로, 일·월 탄력 과금. 요금을 확인하고 M4 클라우드 렌탈 비용과 대조하세요.
SECTION 06 자주 묻는 질문 FAQ
DeepSeek V4와 V3.2의 가장 큰 차이는 무엇인가요?
가장 직접적인 차이는 네이티브 100만 토큰 컨텍스트와 장문 시 연산·메모리 대폭 절감입니다(공식: V4-Pro는 1M 시 FLOPs가 V3.2의 27%, KV Cache 10%). 또한 Agent 능력 전문 최적화로 Claude Code, OpenCode 등 주요 Agent 도구에 적합합니다.
일상적으로 V4 Flash와 V4 Pro 중 무엇을 선택해야 하나요?
일반 대화, 단순 태스크, 대규모 저비용 호출(배치 처리, Agent 파이프라인)이라면 V4-Flash-0731의 가성비가 높고 Agent 점수도 V4-Pro 프리뷰를 넘섭니다. 깊은 세계 지식·복잡 추론이 필요하고 예산이 여유롭다면 V4-Pro 프리뷰를 쓰고 공식판 출시 후 재평가하세요.
V4 Pro 공식판을 지금 쓸 수 있나요?
2026년 8월 5일 기준 아직 아닙니다. 공식판으로 가동 중인 것은 V4-Flash-0731뿐이며 API 전용입니다. V4-Pro 공식판과 Harness는 「가능한 한 빨리」가 공식 표현이며 8/10~20은 미확인 루머입니다.
DeepSeek 벤치마크 수치를 믿어도 되나요?
구분이 필요합니다. SWE-bench Verified 등 제3자 벤치는 비교적 신뢰도가 높고, Terminal Bench 2.0 등 Agent 계열은 미공개 Harness로 측정되었으며 공식도 프레임워크 의존을 경고합니다. Claude Code, Cursor 독립 재현을 기다리는 것이 좋습니다.
이번 업데이트가 일반 개발자에게 어떤 영향을 주나요?
OpenAI 또는 Anthropic 형식으로 DeepSeek API를 쓰는 경우 코드 변경 없이 deepseek-v4-flash가 0731 공식판을 가리킵니다. 폐지된 deepseek-chat·deepseek-reasoner를 쓰는 경우 7월 24일 폐지 후 즉시 새 명칭으로 전환하세요.
DeepSeek Harness란 무엇인가요?
DeepSeek 최초의 자체 Agent 실행 프레임워크로 Claude Code에 대응합니다. 파일 편집, 도구 호출, 다단계 엔지니어링을 담당합니다. 7월 31일 changelog에서 최초 명명되었고 아직 공개되지 않았습니다. 공식 Agent 벤치는 모두 이 프레임워크의 minimal mode로 측정되었습니다.