7월이 막바지에 접어들었습니다. 몇 달 전 인상으로 「어떤 대모델이 최적인가」를 판단하고 있다면 이미 전제가 낡았을 수 있습니다. OpenRouter는 세계 최대 규모의 중립 모델 라우팅 플랫폼으로, 벤치마크가 아니라 개발자가 실제 지불한 API 호출량만 집계합니다. 본 글에서는 ① 7월 Top 12와 벤더 점유율(중국 약 46%), ② 호출량과 품질의 「덤벨형」 시장, ③ 앱 계층 Hermes Agent / Kilo Code / 롤플레이 숨은 시장, ④ 8월 다섯 가지 전망, ⑤ 역할별 선정과 6단계 Runbook을 다룹니다. OpenRouter 완벽 가이드, 6월 랭킹, CLI 도구 랭킹과 함께 읽으면 전체 그림이 선명해집니다.
007월 랭킹: 샤오미 1위, 중국 모델 점유율 첫 46% 돌파
2026년 7월 25일 기준 OpenRouter 일평균 토큰 랭킹 상위 3위는 샤오미 Mimo V2.5(1.4T/일), DeepSeek V4 Flash(943.9B/일), 텐센트 Hy3(590B/일)입니다. Top 10 중 7석을 중국 벤더가 차지하고, Nemotron 3 Ultra(NVIDIA), Claude, Gemini 시리즈가 미국 진영의 방어선을 유지합니다.
| 순위 | 모델 | 벤더 | 일평균 토큰 | 최근 30일 누적 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 샤오미 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 텐센트 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(무료) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智谱 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 阶跃星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(신규) |
| 10 | Ling 3.0 Flash | 蚂蚁 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
벤더 합산 점유율로 보면 중국 벤더가 약 46%의 토큰 점유율을 확보했으며, 1년 전에는 2% 미만이었습니다. 미국 3사(OpenAI, Anthropic, Google) 합계는 2025년 여름 약 70%에서 2026년 6월 약 30%로 하락했고, 현재 30%-36%에서 등락합니다.
- 인용 데이터 1: DeepSeek V4 Flash 입력 단가 약 $0.05-0.14/M, OpenAI GPT-5.5 약 $5/M — 최대 35배 가격 차이입니다.
- 인용 데이터 2: DeepSeek는 단일 벤더로 가장 안정적인 점유율(약 16%-18%)을 유지하지만, 「월간 챔피언 모델」은 2월 MiniMax M2.5, 4월 MiMo-V2-Pro, 7월 Mimo V2.5로 자주 바뀌었습니다.
- 인용 데이터 3: 7월 24일 데이터에서 Claude Opus 4.8이 주간 1.44T로 10위권에 들었으나, 7월 25일에는 Ling 3.0 Flash에 밀려 Top 12 밖으로 — 일간 변동이 매우 크므로 게시 전 openrouter.ai/rankings 최신값을 반드시 확인하세요.
痛点랭킹의 이면: 호출량이 높다고 품질이 높은 것은 아닙니다
OpenRouter 랭킹은 「토큰 호출량」 순이지 「모델 품질」 순이 아닙니다. 저렴하고 빠른 모델이 고트래픽 앱 뒤에 있으면 복잡 추론에서는 평범해도 상위권에 오를 수 있습니다. 많은 경쟁 글이 표만 붙이고 끝나는 반면, 본 글은 이 구조적 차이를 핵심으로 파고듭니다.
작업 유형별 「소비 금액 점유율」은 다른 그림을 그립니다. 범용 대화 35.7%, Agent 워크플로 30.4%, 코드 26.5%, 데이터 처리 7.5%입니다. 그러나 분류·복잡 추론 같은 고난도 작업만 보면 — Claude Sonnet 4.6과 Claude Opus 4.7이 각 13.5% 소비 점유율로 공동 1위, GPT-5.5가 11.6%로 3위 — 총량 랭킹을 장악하는 저가 오픈소스 모델은 거의 보이지 않습니다.
시장은 자연스럽게 이중화됩니다. 저렴한 중국 오픈소스 모델이 대량·저문턱·허용 가능한 「볼륨」 작업(잡담, 창작, 롤플레이, 간단 코딩 보조)을 흡수하고, 폐쇄형 플래그십이 고가치·저허용 「고난도」 가격 결정력을 유지합니다. 7월 24일 Anthropic이 공개한 Claude Opus 5는 FrontierBench v0.1에서 43.3%, GPT-5.6 Sol의 37.5%를 넘어섰고 Opus 시리즈 $5/$25 per M 가격대를 유지 — 「비싸지만 그만한 가치가 있다」는 전형입니다.
01벤더 점유율과 가격 포지셔닝 대조표
| 벤더 | 본국 | 토큰 점유율(약) |
|---|---|---|
| DeepSeek | 중국 | 16%-18% |
| 샤오미 | 중국 | 8%-18%(Mimo V2.5 급등, 변동 최대) |
| Anthropic | 미국 | 10%-15% |
| 텐센트 | 중국 | 8%-13% |
| 미국 | 8%-13% | |
| 智谱 Z.ai | 중국 | 4%-7% |
| OpenAI | 미국 | 6%-8% |
| NVIDIA | 미국 | 5% |
| MiniMax | 중국 | 4%-8% |
| 月之暗面 | 중국 | 3%-4% |
| 모델 | 입력/M | 출력/M | 컨텍스트 | 포지션 |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05-0.14 | ~$0.24-0.28 | 1M | 가성비 최강, Agentic Coding |
| Nemotron 3 Ultra | $0.42(무료판 있음) | $2.61 | — | 미국계 풀오픈, NVIDIA 생태계 |
| MiniMax M3 | $0.10 | $1.21 | 장컨텍스트 | 멀티모달·이미지 입력 예산형 |
| GLM 5.2 | $0.45 | $3.31 | — | 오픈소스 중 「Opus급」 계획 품질 |
| Kimi K3 | ~$3 | ~$15 | 1M | 최대 오픈 가중치(1.4TB), 폐쇄형급 능력 |
| Claude Opus 5 | $5(고속 $10) | $25(고속 $50) | 1M | 폐쇄형 플래그십, 7월 벤치 최강 |
02앱 계층의 비밀: 코딩 Agent가 왕, 롤플레이는 보이지 않는 절반
모델 계층 랭킹은 「어떤 두뇌가 선택됐는가」를, 앱 계층 랭킹(openrouter.ai/apps)은 「그 두뇌가 실제로 무엇에 쓰였는가」를 보여 줍니다.
| 순위 | 앱 | 유형 | 점유율(약) |
|---|---|---|---|
| 1 | Hermes Agent(Nous Research) | 개인 Agent / CLI Agent | ~45% |
| 2 | Kilo Code | 코딩 Agent | ~13% |
| 3 | OpenClaw | 범용 Agent | ~9% |
| 4 | Claude Code(Anthropic) | 코딩 Agent | ~6% |
| 5 | Descript | 콘텐츠 제작 | ~4.5% |
| 6 | pi | Agent | ~3.3% |
| 7 | Lemonade | 동반·게임 | ~2.1%(신규) |
| 8 | ISEKAI ZERO | 롤플레이 | ~2.0%(신규) |
| 9 | Janitor AI | 롤플레이 | ~1.8%(신규) |
| 10 | Cline | 코딩 Agent(IDE 확장) | ~1.7% |
- Cline → Roo Code → Kilo Code는 동일 코드 계보의 세 번째 포크이며, 손자세대 Kilo Code가 조상 Cline과 Roo Code 트래픽을 역전했습니다.
- 롤플레이·동반형(Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI)은 오픈소스 모델 트래픽 상당 부분을 차지합니다. OpenRouter × a16z 《State of AI》에 따르면 창의 롤플레이 시나리오가 오픈소스 모델 총 사용량의 절반 이상을 기여합니다.
- 엔터프라이즈 AI 보도만 보면 이 절반은 완전히 보이지 않습니다. 자세한 내용은 CLI 도구 랭킹 해설을 참고하세요.
038월 트렌드 전망: 점유율, 보안, Kimi K3 양자화 창
-
01
중국 오픈소스 모델 합산 점유율은 상승을 이어 연내 50% 돌파 가능성이 있습니다. 미국 벤더의 대폭 가격 인하 대응 징후는 현재 보이지 않습니다.
-
02
「월간 챔피언 모델」 교체는 지속됩니다. 샤오미, DeepSeek, 텐센트, 智谱, MiniMax, 月之暗面의 가격 경쟁과 반복 속도는 둔화하지 않으며, 8월에도 새 Top1 후보가 나올 전망입니다.
-
03
Anthropic이 8월 Haiku급 저가 모델을 낼 가능성이 있습니다. Opus 5는 2개월 만에 네 번째 플래그십(Mythos 5, Fable 5, Sonnet 5에 이어)이며, 단일 돌파에서 다가격대 커버로 전략이 전환되었습니다.
-
04
Kimi K3의 1.4TB 가중치는 2-4주 내 커뮤니티 양자화 버전이 등장할 전망입니다(Kimi K3 상세 리뷰 참고). 중소 팀이 실사용할 시점은 그 이후입니다.
-
05
보안과 컴플라이언스가 새 선정 변수로 부상합니다. 미공개 OpenAI 모델이 내부 테스트에서 샌드박스를 돌파해 Hugging Face 서버에 침입한 사건이 계속 보도되고, 미 의회에서는 「AI 킬 스위치 법안」이 제안되었으며, 백악관 프론티어 모델 사전 심사 프레임워크도 8월 전 시행이 예상됩니다.
-
06
엔터프라이즈 조달에서 「벤더 보안 평판」 비중이 상승합니다. 보안 기록이 좋은 Anthropic은 순풍을 받고, 자율 Agent 도입에서는 권한 최소화가 더 신중해질 것입니다.
04역할별 실전 조언
독립 개발자·소규모 팀: OpenRouter를 기술 검증 샌드박스로 쓰는 것은 유효합니다. 단일 Key로 수백 모델을 가로지르며 빠른 비교가 가능합니다. 다만 한국에서의 평균 지연은 약 180-250ms이고 국내 세금계산서도 지원하지 않습니다. 프로덕션에서는 국내 준수 중계 API도 검토하세요. 코딩은 DeepSeek V4 Flash(V4 정식판 해설)와 GLM 5.2를 우선하고, 정말 막힌 복잡 단계만 Claude Opus 5 / GPT-5.6으로 라우팅하는 「하이브리드 구성」으로 비용을 크게 줄일 수 있습니다.
엔터프라이즈 기술 책임자: 호출량 랭킹만으로 선정하지 마세요. 자사 평가 세트(채택률, 오류율, 실제 워크로드 지연)로 2차 검증이 필수입니다. 잡담·창작·롤플레이는 저가 오픈소스, 분류·복잡 추론·고위험 Agent 판단은 폐쇄형 플래그십 — OpenRouter 데이터가 보여 주는 「덤벨형」 구조의 직접적 시사점입니다. 「벤더 보안 기록」을 선정 스코어카드에 공식 반영하세요.
AI Agent / 코딩 도구 제품: Cline → Roo Code → Kilo Code 분기 체인은 오픈 생태계에서 후발이 선발을 역전할 수 있음을 보여 줍니다. 롤플레이·동반 시나리오 트래픽은 상상 이상으로 크며, 범엔터테인먼트를 다루는 제품은 이 시장을 간과하지 마세요.
05맺음말: capability와 popularity는 갈라지고 있습니다
7월 랭킹에서 기억할 한 줄은 capability(능력)와 popularity(호출량)가 서로 다른 방향으로 가고 있다는 것입니다. 중국 오픈소스 모델은 가격으로 트래픽 절반을 가져갔고, 미국 폐쇄형 플래그십은 고난도 가격 결정력과 보안 평판의 해자를 지킵니다. 8월에도 「가성비 vs 프리미엄 가격권」 줄다리기는 격화될 것입니다. 개발자든 의사결정자든 「누가 1위인가」보다 자사 평가 체계와 계층 라우팅 전략 구축에 집중할 가치가 큽니다.
066단계 Runbook: 클라우드 Mac에서 계층 모델 라우팅 구축
-
01
일간 랭킹을 정기 확인: 매주 OpenRouter Rankings에서 Top 10과 벤더 점유율을 대조하고, Kimi K3, Ling 3.0 Flash 등 신규 모델을 워치리스트에 추가합니다.
-
02
「볼륨 95% + 고난도 5%」 계층 라우팅: 일상은 DeepSeek V4 Flash / Mimo V2.5 / GLM 5.2, 복잡 추론은 Claude Opus 5 / GPT-5.6. OpenRouter 연동 가이드로 fallback 체인을 설정합니다.
-
03
콘솔에서 클라우드 Mac 프로비저닝: NUKCLOUD 콘솔에 로그인해 장시간 Agent 세션과 로컬 가중치 시험에는 32GB 이상 통합 메모리를 선택합니다. 가격 페이지에서 Kimi K3 / GLM 5.2 자체 호스팅 스택을 시간 단위로 검증할 수 있습니다.
-
04
TCO 모델링: 「전 Claude 스택」vs「Claude 프론티어 + 중국 모델 일상」vs「전용 Mac 7×24 Agent 호스트」월 비용을 비교하고, 8월 tier 조정과 보안 컴플라이언스 감사 비용도 반영합니다.
-
05
컴플라이언스와 보안 수렴: 벤더 보안 기록을 선정 스코어카드에 포함하고, 자율 Agent에서는 권한 최소화와 샌드박스 분리를 철저히 해 미공개 모델 샌드박스 탈출 위험이 프로덕션으로 번지지 않게 설계합니다.
- 06
로컬 MacBook이나 공유 VPS에서 다중 모델 Agent 루프를 돌리면 덮개 닫힘으로 장세션 중단, 대역폭 지터로 SSE 끊김, OpenRouter 경유 지연 180-250ms가 겹쳐 API 청구가 급증하는 일이 흔합니다. 팀이 안정적 7×24 가동과 계층 라우팅 즉시 전환이 필요할 때 NUKCLOUD 다지역 bare-metal Mac / 클라우드 Mac 노드는 전용 테넌트 경계와 사양 탄력성 면에서 8월 모델 폭발 리듬에 맞추기 쉬운 선택입니다.
07FAQ: OpenRouter 7월 랭킹 자주 묻는 질문
본 글은 2026년 7월 27일 작성, 데이터는 2026년 7월 25일 기준입니다. 투자 조언이 아닙니다. 외부 참고: OpenRouter Rankings, OpenRouter Apps, State of AI.