En fin juillet 2026, raisonner encore avec l'image du marché d'il y a trois mois conduit à de mauvaises décisions. OpenRouter ne mesure pas les benchmarks marketing : il agrège le trafic payant des développeurs. Cet article couvre : (1) le Top 12 modèles et les parts fabricants, Chine ~46 % ; (2) la structure en haltère volume vs qualité ; (3) la couche applications Hermes Agent, Kilo Code et le marché roleplay invisible ; (4) cinq tendances pour août ; (5) conseils par profil et runbook en six étapes. À lire avec : guide API OpenRouter, classement de juin, outils CLI.
00Juillet : Xiaomi numéro un, les modèles chinois franchissent 46 %
Au 25 juillet 2026, le podium quotidien OpenRouter : Xiaomi Mimo V2.5 (1,4 T tokens/jour), DeepSeek V4 Flash (943,9 B) et Tencent Hy3 (590 B). Sept modèles sur douze sont chinois ; seuls Nemotron 3 Ultra (NVIDIA), Claude et Gemini maintiennent le camp américain.
| Rang | Modèle | Éditeur | Tokens / jour | Cumul 30 j |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4 T | 31,2 T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9 B | 23,6 T |
| 3 | Hy3 | Tencent | 590 B | 23,4 T |
| 4 | Nemotron 3 Ultra 550B (gratuit) | NVIDIA | 428,6 B | 9 T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7 B | 11,6 T |
| 6 | GLM 5.2 | Z.ai | 316,7 B | 13,3 T |
| 7 | MiniMax M3 | MiniMax | 262,5 B | 15,1 T |
| 8 | Step 3.7 Flash | StepFun | 204,8 B | 5,9 T |
| 9 | Kimi K3 | Moonshot AI | 157,6 B | 1,6 T (nouveau) |
| 10 | Ling 3.0 Flash | Ant InclusionAI | 128,3 B | 417,3 B |
| 11 | Gemini 3 Flash Preview | 106,3 B | 4 T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5 B | 3,6 T |
À l'échelle fabricant : les éditeurs chinois totalisent ~46 % des tokens — contre moins de 2 % il y a un an. Le trio US (OpenAI, Anthropic, Google) est passé de ~70 % mi-2025 à ~30 % en juin 2026, puis oscille entre 30 % et 36 %.
- Chiffre 1 : DeepSeek V4 Flash en entrée ~0,05–0,14 $/M, GPT-5.5 ~5 $/M — écart ×35.
- Chiffre 2 : DeepSeek reste le fabricant le plus stable (~16–18 %), mais le champion mensuel change : fév. MiniMax M2.5 → avr. MiMo-V2-Pro → juil. Mimo V2.5.
- Chiffre 3 : Claude Opus 4.8 était Top 10 le 24/7 (1,44 T hebdo), évincé le 25/7 par Ling 3.0 Flash — vérifier openrouter.ai/rankings avant publication.
PiègesL'envers du classement : volume élevé ≠ qualité élevée
OpenRouter classe par consommation de tokens, pas par capacité. Un modèle bon marché derrière une app à fort trafic monte facilement — même s'il faiblit sur le raisonnement difficile. C'est l'angle que la plupart des articles de comparaison ignorent.
Par type de tâche, la répartition des dépenses raconte une autre histoire : dialogue général 35,7 %, workflows Agent 30,4 %, code 26,5 %, traitement de données 7,5 %. Sur classification et raisonnement complexe : Claude Sonnet 4.6 et Claude Opus 4.7 à 13,5 % chacun, GPT-5.5 à 11,6 % — les modèles open source bon marché du Top volume sont quasi absents.
Le marché se stratifie : les modèles chinois open source absorbent le volume tolérant aux erreurs (chat, créatif, roleplay, aide code simple), tandis que les modèles fermés gardent le pricing des tâches critiques. Claude Opus 5 (24 juillet) atteint 43,3 % sur FrontierBench v0.1, devant GPT-5.6 Sol (37,5 %) à 5 $/25 $ par M.
01Parts fabricants et matrice tarifaire
| Éditeur | Origine | Part tokens (env.) |
|---|---|---|
| DeepSeek | Chine | 16–18 % |
| Xiaomi | Chine | 8–18 % (Mimo V2.5, forte volatilité) |
| Anthropic | États-Unis | 10–15 % |
| Tencent | Chine | 8–13 % |
| États-Unis | 8–13 % | |
| Z.ai | Chine | 4–7 % |
| OpenAI | États-Unis | 6–8 % |
| NVIDIA | États-Unis | 5 % |
| MiniMax | Chine | 4–8 % |
| Moonshot AI | Chine | 3–4 % |
| Modèle | Entrée/M | Sortie/M | Contexte | Positionnement |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~0,05–0,14 $ | ~0,24–0,28 $ | 1M | Roi rapport qualité-prix, Agentic Coding |
| Nemotron 3 Ultra | 0,42 $ (gratuit dispo) | 2,61 $ | — | Open source US, écosystème NVIDIA |
| MiniMax M3 | 0,10 $ | 1,21 $ | Long | Multimodal budget |
| GLM 5.2 | 0,45 $ | 3,31 $ | — | Planification « type Opus » en open source |
| Kimi K3 | ~3 $ | ~15 $ | 1M | Plus gros poids ouverts (1,4 To) |
| Claude Opus 5 | 5 $ (rapide 10 $) | 25 $ (rapide 50 $) | 1M | Frontier fermé, meilleurs scores juillet |
02Couche apps : les agents code dominent, le roleplay est la moitié cachée
Les classements modèles montrent quel « cerveau » est choisi ; les classements apps montrent l'usage réel :
| Rang | App | Type | Part (env.) |
|---|---|---|---|
| 1 | Hermes Agent (Nous Research) | Agent personnel / CLI | ~45 % |
| 2 | Kilo Code | Agent code | ~13 % |
| 3 | OpenClaw | Agent généraliste | ~9 % |
| 4 | Claude Code (Anthropic) | Agent code | ~6 % |
| 5 | Descript | Production de contenu | ~4,5 % |
| 6 | pi | Agent | ~3,3 % |
| 7 | Lemonade | Compagnie / jeu | ~2,1 % (nouveau) |
| 8 | ISEKAI ZERO | Roleplay | ~2,0 % (nouveau) |
| 9 | Janitor AI | Roleplay | ~1,8 % (nouveau) |
| 10 | Cline | Agent code (IDE) | ~1,7 % |
- Cline → Roo Code → Kilo Code : trois générations d'une même lignée ; Kilo Code dépasse aujourd'hui ses ancêtres.
- Les apps roleplay et compagnie (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) représentent une part majeure du trafic open source — plus de la moitié en roleplay créatif selon OpenRouter × a16z State of AI.
- La presse enterprise ne voit pas cette moitié du marché. Voir analyse des outils CLI.
03Prévisions août : parts, sécurité et fenêtre Kimi K3
-
01
Les modèles chinois open source pourraient dépasser 50 % sans concession tarifaire majeure des US. Aucun signal de baisse agressive chez OpenAI ou Google.
-
02
Le champion mensuel continuera de changer. Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot maintiennent guerre des prix et rythme de release — un nouveau Top 1 est probable en août.
-
03
Anthropic pourrait lancer un modèle plus abordable (niveau Haiku) pour gagner du volume — Opus 5 est déjà le quatrième flagship en deux mois.
-
04
Les poids 1,4 To de Kimi K3 auront des quantisations communautaires en 2–4 semaines (voir test Kimi K3) — moment où les petites équipes pourront l'exploiter.
-
05
Sécurité et conformité deviennent des variables de choix. Fuites sur des évasions de sandbox, projet de loi « kill switch » au Congrès US et cadre de pré-publication des modèles frontier attendu avant août.
-
06
La réputation sécurité des éditeurs pèse davantage en achat entreprise — avantage Anthropic, prudence accrue sur les agents autonomes à larges permissions.
04Conseils pratiques par profil
Développeurs indépendants et petites équipes : OpenRouter est une excellente sandbox — une clé, des centaines de modèles. En production : latence Europe vers OpenRouter souvent 180–250 ms, facturation locale limitée. Code : tester DeepSeek V4 Flash (analyse V4 GA) et GLM 5.2 ; réserver Claude Opus 5 / GPT-5.6 aux étapes bloquées — le routage hybride réduit fortement la facture.
Responsables techniques entreprise : ne pas choisir sur le seul classement volume. Évals internes obligatoires (taux d'acceptation, erreurs, latence sous charge). Stratifier : chat/créatif/roleplay sur modèles open source bon marché ; classification, raisonnement complexe et décisions Agent à risque sur frontier fermé — la structure en haltère des données OpenRouter. Intégrer la réputation sécurité dans la grille de notation.
Produits Agent et outils de code : la chaîne Cline→Kilo Code montre qu'un successeur open source peut dépasser le pionnier. Le roleplay porte plus de volume que la plupart des rapports enterprise ne le suggèrent.
05Conclusion : capability et popularité divergent
La leçon de juillet en une phrase : capacité et popularité prennent des chemins séparés. Les modèles chinois open source gagnent le trafic par le prix ; les frontier US fermés gardent le pricing et le récit sécurité sur les tâches difficiles. En août, la tension prix vs premium s'intensifiera — plus utile qu'un débat « qui est numéro un » : construire sa propre évaluation et son routage par couches.
06Runbook en six étapes : routage par couches sur Mac cloud
-
01
Suivre le classement quotidien : chaque semaine consulter OpenRouter Rankings ; ajouter Kimi K3 et Ling 3.0 Flash à la liste de veille.
-
02
Routage 95 % volume + 5 % frontier : quotidien via DeepSeek V4 Flash / Mimo V2.5 / GLM 5.2 ; raisonnement difficile via Claude Opus 5 / GPT-5.6. Chaîne de fallback selon le guide API.
-
03
Provisionner un Mac cloud : dans la console NUKCLOUD, choisir 32 Go+ de mémoire unifiée pour les sessions Agent longues ; tester Kimi K3 / GLM 5.2 à l'heure sur la page tarifs.
-
04
Modéliser le TCO : « stack Claude intégral » vs « frontier Claude + modèles chinois quotidiens » vs Mac dédié 7×24 ; intégrer ajustements de tiers août et audit conformité.
-
05
Conformité et sécurité : réputation sécurité dans la grille ; agents autonomes avec permissions minimales et sandbox.
-
06
Agent launchd 7×24 : après pilote, verrouiller la spec via commander ; détails dans le runbook production et le centre d'aide.
Les agents multi-modèles sur MacBook local ou VPS surchargé échouent sur sommeil au rabat, coupures SSE et factures API qui explosent. Pour rester 7×24 en ligne et changer de route librement, les nœuds Mac cloud NUKCLOUD multi-régions offrent une frontière locataire dédiée alignée sur le rythme des releases d'août.
07FAQ : classement OpenRouter juillet
Rédigé le 27 juillet 2026, données au 25 juillet 2026. Pas de conseil en investissement. Sources : OpenRouter Rankings, OpenRouter Apps, State of AI.