/ 블로그 / OpenRouter
ENGINEERING_BLOG · 2026.07.27

OpenRouter 2026년 7월 랭킹: AI 모델 경쟁에서 실제로 누가 이기고 있는가

OPENROUTER · 2026년 7월 TOKEN MIX
46%

중국 오픈 모델이 전체 token volume의 거의 절반을 차지합니다. 사용량과 품질은 빠르게 갈라지고 있습니다.

요약: OpenRouter 랭킹을 품질 순위표로 해석하면 프로덕션 트래픽을 잘못 라우팅하게 됩니다. 2026년 7월 데이터는 barbell 시장을 보여 줍니다. Xiaomi Mimo V2.5가 요금·가용성 기준으로 하루 약 1.4T token으로 1위이고, DeepSeek V4 Flash가 mid-tier 오픈 스택을 담당하며, 중국 모델 합산 46%를 차지합니다. 반면 어려운 reasoning task에서는 서구 프리미엄 tier가 여전히 우위입니다. Hermes Agent만 귀속 앱 share 약 45%를 차지해, 게이트웨이 트래픽을 이끄는 주체가 채팅 UI가 아니라 코딩 Agent임을 확인합니다. 본문은 리더보드를 올바르게 읽어야 하는 엔지니어·기술 리더를 대상으로, 랭킹 해석 4가지 맹점, 상위 모델 의사결정 매트릭스, 앱 계층 분석, 실전 6단계, 7월 인용 수치, 8월 전망, 네이티브 컴파일 인프라 연결까지 다룹니다. 결론: 순위가 아니라 워크로드 tier에 맞춰 최적화하세요. Agent loop에는 저가 오픈 모델, 최종 pass에는 frontier 모델을 쓰고, token volume을 벤치마크 1위와 혼동하지 마세요.

SECTION 01 OpenRouter 랭킹을 읽을 때 흔히 놓치는 4가지 맹점

  • Volume은 품질이 아닙니다: 랭킹은 라우팅된 token 수를 집계하며, 답변 정확도는 측정하지 않습니다. Agent 프레임워크는 task당 50–200회의 소형 completion을 발생시키므로, $0.10/M 모델이 $25/M frontier 모델보다 상위에 올라갈 수 있으면서 최종 출력 품질은 더 낮을 수 있습니다.
  • 가격이 리더보드를 왜곡합니다: Xiaomi Mimo V2.5와 DeepSeek V4 Flash는 공격적인 per-million 요율에 있습니다. bulk summarization, lint 수정, retrieval pre-processing을 돌리는 팀은 허용 가능한 최저 tier로 spend-weighted volume이 자연스럽게 집중됩니다.
  • 귀속 공백이 실제 클라이언트를 숨깁니다: HTTP-RefererX-Title 헤더를 보내는 앱만 앱 리더보드에 표시됩니다. self-hosted Agent와 custom backend는 과소 집계될 수 있습니다. 헤더 설정은 OpenRouter API 연동 가이드를 참고하세요.
  • 지역별 출시 시점이 월간 스냅샷을 skew합니다: 월 중반에 출시된 모델은 incumbant보다 적은 calendar day를 확보합니다. 7월 27일 Kimi K3 open-weight drop이 Agent 기본값에 완전히 반영되기 전까지 2026년 7월 랭킹은 Kimi K3를 과소 반영합니다.

SECTION 02 OpenRouter 2026년 7월 상위 모델: token 1위 vs 품질 tier

2026년 7월 OpenRouter 모델 랭킹은 Artificial Analysis나 LMSYS 점수가 아니라 게이트웨이 트래픽 합계를 반영합니다. 아래 표는 순위와 각 모델이 프로덕션에서 실제로 담당하는 워크로드를 매핑합니다.

OpenRouter 2026년 7월 token volume 상위 모델
순위 모델 추정 일일 token 대표 워크로드
#1 Xiaomi Mimo V2.5 ~1.4T/일 bulk Agent loop, 다국어 채팅, 비용 민감 pre-processing
#2 DeepSeek V4 Flash ~890B/일 코드 completion, tool-call chain, off-peak batch job
#3 Qwen3-235B-A22B ~520B/일 long-context retrieval, structured JSON extraction
#4 Claude Opus 5 ~410B/일 최종 reasoning pass, 아키텍처 리뷰, 고위험 codegen
#5 GPT-5.6 Sol (preview) ~380B/일 multi-step planning, 엄격 SLA enterprise copilot
Barbell 패턴 중국 오픈 스택 vs 서구 frontier 46% / 54% 분할 저가 volume은 오픈 tier, 프리미엄 spend는 closed tier — 중간 tier는 거의 없음

OpenRouter 랭킹은 「무엇이 가장 똑똑한가」보다 「대규모로 가장 저렴하게 돌릴 수 있는가」에 더 가깝게 답합니다. 1위를 비용 신호로 보고, capability 보증으로 보지 마세요.

DeepSeek V4 Flash는 barbell 양끝을 잇는 모델로 별도 주목할 가치가 있습니다. DeepSeek V4 GA 출시 분석에서 CSA+HCA 아키텍처와 peak-valley 요금을 다루었으며, OpenRouter의 Flash variant는 context overhead를 줄여 sub-2-second TTFT Agent turn을 유지하면서 full V4 대비 SWE-bench-class codegen을 약 4pt 이내로 유지합니다.

SECTION 03 중국 모델 46%: 무엇이 바뀌었고 누가 비용을 지불하는가

중국산 오픈 모델은 2026년 7월 OpenRouter 전체 token volume의 46%를 넘어섰으며, 4월 약 31%에서 상승했습니다. 점프를 이끈 3가지 요인은 모두 「중국 모델이 갑자기 서구 frontier보다 똑똑해졌다」는 뜻은 아닙니다.

OpenRouter 지역별 token share 변화 (2026년 4월 vs 7월)
출처 cluster 2026년 4월 share 2026년 7월 share 주요 driver
중국 오픈 (DeepSeek, Xiaomi, Qwen, Moonshot API) ~31% 46% sub-$1/M output tier, Agent loop 경제성, rate limit된 서구 API에서 OpenRouter failover
미국 closed (OpenAI, Anthropic, Google) ~52% ~41% Opus 5 요금 인하가 volume 손실을 일부 상쇄. 최종 pass reasoning spend는 여전히 우위
EU / 기타 오픈 (Meta, Mistral, Cohere) ~17% ~13% self-host niche는 안정적. Agent 프레임워크 기본값 채택은 제한적
Agent task당 비용 서구 전용 스택 100-step loop당 ~$0.18–0.42 중국 오픈 primary + 서구 final pass: 100-step loop당 ~$0.04–0.11

7월의 핵심 이야기는 사용량 ≠ 품질 분열입니다. Hermes 스타일 코딩 Agent를 돌리는 팀은 tool-call turn의 80%를 Mimo V2.5 또는 DeepSeek V4 Flash로 라우팅하고, merge-review와 아키텍처 결정에만 Claude Opus 5 또는 GPT-5.6 Sol을 쓰면 월간 inference spend를 60–75% 줄이면서 human-evaluated 출력 품질 벤치마크는 크게 움직이지 않을 수 있습니다.

SECTION 04 앱 리더보드: Hermes Agent와 코딩 Agent의 장악

OpenRouter는 모델 share와 별도로 귀속 앱 share를 공개합니다. 2026년 7월 앱 랭킹은 consumer chat wrapper가 아니라 자율 코딩 Agent가 게이트웨이 트래픽을 지배함을 확인합니다.

OpenRouter 2026년 7월 귀속 token share 상위 앱
순위 Share 워크로드 패턴
#1 Hermes Agent ~45% multi-file refactor, terminal tool loop, task당 100+ completion
#2 Continue.dev ~12% IDE inline completion, diff-aware edit
#3 OpenHands ~9% sandbox repo Agent, CI-triggered fix
#4 LibreChat ~7% 사용자 선택 라우팅 multi-model chat UI
#5 Custom / 미귀속 ~27% Referer 헤더가 없는 self-hosted backend
시사점 코딩 Agent가 모델 1위를 견인 Agent loop는 cheap tier 선호 모델 리더보드는 chat 인기가 아니라 Agent 경제성을 반영

Hermes Agent의 45% share가 Xiaomi Mimo V2.5와 DeepSeek V4 Flash가 모델 차트 상단에 있는 이유를 설명합니다. refactor task 하나가 수십 번의 소형·저위험 completion을 만들며, 이는 cheap open 모델이 잘 처리하는 워크로드입니다. Agent가 macOS에서 compile·sign·test까지 수행한다면 inference 절감은 build chain이 compliant native hardware에서 돌아갈 때만 의미가 있습니다. 이 연결은 본문 후반 VPSNIX 섹션에서 다룹니다.

SECTION 05 OpenRouter 랭킹을 활용하는 6단계와 7월 핵심 수치·8월 전망

  1. Volume 순위와 품질 tier를 분리합니다: GET /api/v1/models로 live 모델 목록을 가져와 각 slug를 「bulk」「mid」「frontier」로 태깅합니다. 순위만 보고 #1 모델을 final-review duty로 승격하지 마세요.
  2. 귀속 헤더를 설정합니다: 모든 프로덕션 클라이언트에 HTTP-RefererX-Title을 설정해 OpenRouter analytics에 앱이 올바르게 표시되고 워크로드별 spend를 감사할 수 있게 합니다.
  3. two-tier fallback chain을 구성합니다: tool loop primary는 DeepSeek V4 Flash 또는 Mimo V2.5, primary가 low-confidence를 반환하거나 context limit에 닿으면 Claude Opus 5 또는 GPT-5.6 Sol로 fallback합니다. OpenRouter API 가이드에 문서화된 models 배열과 route: "fallback"을 사용하세요.
  4. 실제 prompt로 벤치마크합니다: 상위 3개 ranked 모델과 frontier fallback에 프로덕션 prompt 50개를 돌려 pass rate를 비교합니다. 기본값 변경 전 token cost가 아니라 pass rate를 기준으로 판단하세요.
  5. 지역 share를 월별로 추적합니다: 중국 오픈 share가 계속 오르면 규제·enterprise security review가 reactive migration을 강요하기 전에 data-residency 정책과 BYOK routing을 재평가하세요.
  6. 출시 캘린더를 반영합니다: Kimi K3 open weights는 7월 27일 공개됩니다. 며칠 내 Agent 프레임워크가 K3 slug를 추가할 것으로 예상됩니다. major drop 직후 주간 재벤치마크를 실행하세요. 7월 랭킹은 8월 중순이면 달라집니다. Kimi K3 open weights 출시 가이드에서 hardware·license 준비를 확인하세요.
two_tier_agent.mjs
import OpenAI from "openai";

const openai = new OpenAI({
  baseURL: "https://openrouter.ai/api/v1",
  apiKey: process.env.OPENROUTER_API_KEY,
});

const response = await openai.chat.completions.create({
  model: "deepseek/deepseek-v4-flash",
  models: [
    "deepseek/deepseek-v4-flash",
    "anthropic/claude-opus-5",
  ],
  route: "fallback",
  messages: [{ role: "user", content: "Refactor auth middleware for JWT rotation." }],
  extra_headers: {
    "HTTP-Referer": "https://your-app.example",
    "X-Title": "Your Agent Name",
  },
});
OpenRouter 2026년 7월 핵심 지표
지표
token volume 1위 모델 Xiaomi Mimo V2.5 — ~1.4T token/일
중국 오픈 모델 share 게이트웨이 volume 46%
귀속 share 1위 앱 Hermes Agent — ~45%
DeepSeek V4 Flash 일일 volume ~890B token/일 (전체 #2)
Barbell 시장 패턴 cheap open tier가 Agent loop 흡수, 서구 frontier tier가 final-pass spend 유지
품질 신호 랭킹은 비용 × 가용성 × Agent-loop volume을 측정 — 벤치마크 1위가 아님

2026년 8월 전망 — 주목할 3가지 시나리오:

  • Kimi K3 open-weight shock: Moonshot의 7월 27일 Hugging Face drop은 Modified MIT 하에 1M context 2.8T MoE를 추가합니다. Agent 프레임워크가 며칠 내 DeepSeek V4 Flash와 K3를 A/B할 것입니다. K3 tool-call latency가 OpenRouter에서 TTFT 800ms 미만이면 중국 오픈 share가 50%를 넘길 수 있습니다.
  • Opus 5 price gravity: Anthropic이 7월 24일 API 요율을 절반으로 낮췄습니다. 팀이 final-pass work를 GPT-5.6 Sol 대신 Opus 5로 더 많이 라우팅하면 서구 frontier share가 안정되거나 반등할 수 있습니다. 특히 Claude Opus 5 출시 발표가 API data retention 없음을 강조한 이후입니다.
  • DeepSeek peak-pricing normalization: 7월 24일 GA 마이그레이션 이후 off-peak 할인이 조정될 수 있습니다. V4 Flash 사용자는 8월 billing cycle 전에 fallback chain을 고정하고 DeepSeek V4 요금표를 재확인하세요.

7월 실전 요약:

  • 워크로드별 벤치마크 없이 rank #1을 프로덕션 기본값으로 복사하지 마세요.
  • 리더보드는 코딩 Agent가 견인한다고 가정하세요 — chat UX가 아니라 loop cost에 최적화하세요.
  • two-tier stack을 운영하세요 — cheap open primary, frontier fallback — barbell 시장 구조와 맞춥니다.
  • 8월에는 주간 단위로 랭킹을 재확인하세요 — K3와 Opus 5가 며칠 간격으로 출시되어 스냅샷이 빠르게 변합니다.

공식 출처 — OpenRouter 정책·랭킹 방법론 변경 후 아래 링크를 다시 열어 최신 내용을 확인하세요:

OpenRouter 모델 랭킹 — live token volume 리더보드

OpenRouter 앱 랭킹 — 귀속 클라이언트 share

Anthropic — Claude Opus 5 출시 및 요금

OpenRouter는 멀티 모델 inference routing을 해결하지만 iOS binary compile, Apple signing certificate rotation, Metal shader test는 수행하지 않습니다. 가상화 macOS stack은 EULA 리스크를 동반하고 hypervisor overhead로 네이티브 대비 20–40% 성능을 잃는 경우가 많습니다. inference 60% 절감은 Agent가 Xcode build마다 3배 더 기다리면 의미가 줄어듭니다.

코딩 Agent 팀의 실용적 분할은 다음과 같습니다. OpenRouter로 위 two-tier 모델 stack — loop에는 Mimo V2.5 또는 DeepSeek V4 Flash, final review에는 Opus 5 — 을 구성하고, compile·test·deploy를 24×7 수행하는 Hermes 스타일 Agent는 VPSNIX M4 / M4 Pro 물리 노드에서 돌립니다. Kimi K3 open weightsDeepSeek V4를 OpenRouter로 라우팅 중이라면 build chain은 full Root access가 있는 compliant hardware에 고정하는 것이 안전합니다.

hypervisor loss 0, 안정적 iOS CI/CD, AI Agent 24×7 자동화가 필요한 프로덕션 환경에서는 VPSNIX 클라우드 물리 노드가 보통 더 나은 선택입니다. 정품 Apple hardware, complete Root privileges, virtualization tax 없음, 일·주·월 탄력 billing. 현재 요금은 가격 페이지를 참고하세요.

SECTION 06 자주 묻는 질문 FAQ

2026년 7월 OpenRouter에서 가장 많이 쓰이는 모델은 무엇인가요?

Xiaomi Mimo V2.5가 2026년 7월 모델 랭킹 1위로, 하루 약 1.4조 token을 기록했습니다. 벤치마크 순위가 아니라 공격적인 per-token 요금과 강한 다국어 처리량이 volume을 견인했습니다.

OpenRouter 랭킹은 모델 품질을 반영하나요?

아닙니다. 랭킹은 OpenRouter를 통과한 token volume 합계를 측정하며, 품질보다 비용·가용성·Agent loop volume에 더 가깝게 반응합니다. 2026년 7월에는 초저가 오픈 모델과 프리미엄 Claude/GPT tier가 양극화된 barbell 시장이 형성되었습니다.

OpenRouter 트래픽에서 중국 모델 점유율은 얼마인가요?

2026년 7월 OpenRouter 전체 token volume 중 중국산 오픈 모델이 46%를 차지했으며, 4월 약 31%에서 상승했습니다. DeepSeek V4 Flash, Xiaomi Mimo V2.5, Qwen3 계열이 대부분의 전환을 이끌었습니다.

OpenRouter 사용량을 지배하는 앱은 무엇인가요?

Hermes Agent가 2026년 7월 OpenRouter 귀속 앱 share 약 45%로 1위를 기록했습니다. task당 수백 번의 소형 completion을 발생시키는 자율 코딩 Agent 급증을 반영합니다.

OpenRouter 랭킹을 보고 모델을 고를 때 어떻게 해야 하나요?

랭킹을 품질 점수가 아닌 비용·가용성 신호로 봐야 합니다. bulk pre-processing과 tool loop에는 저가 오픈 모델, 최종 reasoning pass에는 frontier closed 모델을 매칭하고, Claude Opus 5나 Kimi K3 open weights 같은 major release 이후에는 재벤치마크하세요.

2026년 8월에 무엇을 주목해야 하나요?

7월 27일 Kimi K3 open-weight 출시가 Agent 기본값을 재편할 가능성이 큽니다. DeepSeek V4 Flash는 GA 마이그레이션 이후 peak 요금 조정을 받을 수 있고, Opus 5 요금 인하가 고가치 코딩 워크로드를 cheap tier에서 되돌리면 서구 frontier share가 반등할 수 있습니다.