Hausse DeepSeek, fleuron Alibaba à 2,4 billions, GLM-5.3 : pourquoi les labos chinois basculent en août

Du 12 au 17 août, DeepSeek installe une tarification heures de pointe jusqu’à plus de 1100 %, Alibaba publie pour la première fois des poids Max à 2,4 billions de paramètres, Zhipu multiplie par six un banc de code sur la même base. L’enjeu n’est plus le plancher, c’est le pouvoir de fixer le prix.

En cinq jours, trois laboratoires chinois font des gestes qui se contredisent en surface et se répondent en profondeur. DeepSeek relève certaines lignes d’API jusqu’à plus de 1100 %. Alibaba ouvre, la même semaine, un fleuron Qwen-Max de 2,4 billions de paramètres jamais publié. Zhipu livre GLM-5.3 sur la base de 743 milliards de GLM-5.2 et obtient presque tout le saut de code par post-entraînement. Le signal commun : on ne se bat plus seulement sur le prix le plus bas, on se bat sur le pouvoir de le fixer. Pour les lancements produits, lire la note Qwen3.8-Max et l’essai V4 Flash ; ici, les poids, la grille horaire et le saut à base inchangée.

00Chronologie de ces deux semaines

DateÉvénement
16 juillet 2026Moonshot AI ouvre Kimi K3 (2,8 billions de paramètres), déjà sous regard de sécurité américain
2–3 aoûtAlibaba annonce puis lance Qwen3.8-Max en API hébergée
10 aoûtMeta publie Muse Glimmer (30 milliards, Apache 2.0) et promet les poids de Muse Spark 1.2
12 aoûtAlibaba dépose Qwen3.8-2.4T-A95B sur ModelScope/Hugging Face ; xAI livre Grok 4.6
13 aoûtDeepSeek-V4-Pro passe en GA et annonce une hausse au 17 août ; Google baisse Gemini 3.7 Flash
14 aoûtZhipu livre GLM-5.3 sur la base 743 milliards de GLM-5.2
17 août, 00:00 PékinLa nouvelle grille DeepSeek s’applique

Plus loin : le 30 juillet, OpenAI baisse de 80 % son palier le moins cher, GPT-5.6 Luna, puis les 6–7 août en fait le modèle par défaut des comptes gratuits, texte illimité. Pendant que les labos chinois ajoutent hausse et ouverture de fleurons, les labos américains ajoutent gratuité et baisse. Ce n’est pas un hasard, ce sont les deux faces du même conflit tarifaire. Voir la note de baisse GPT-5.6.

PiègesCe que les achats interprètent trop vite

  • Lire « 1100 % » comme toute la facture. 11×, 1100 % et 350 % peuvent tous être justes. Ils visent l’entrée cache hit, la sortie et l’entrée cache miss.
  • Supposer l’API officielle toujours la moins chère. En pointe, GMI Cloud et Novita restent sous le tarif officiel.
  • Confondre poids ouverts et Apache 2.0. Qwen3.8-Max porte une licence maison. Un gros MaaS ou assistant IA doit encore négocier.
  • Répéter l’interdiction géographique. Le texte publié n’a aucune clause territoriale. Les seuils sont le chiffre d’affaires et l’affichage du nom.
  • Présenter GLM-5.3 comme une nouvelle base. 743 milliards restent ceux de 5.2. Le saut vient du post-entraînement, chiffres vendeur.
  • Budgéter « modèle chinois = moins cher ». DeepSeek hors pointe reste sous Claude Opus 5, mais Qwen international et Luna le battent déjà sur au moins un axe.

01Les chiffres qui ont bougé

Grille DeepSeek au 17 août, 00:00 Pékin. Pointes : 9–12 h et 14–18 h, heure de Pékin. Unité : par million de tokens.

PosteAncienHors pointePointeHausse pointe
V4-Flash entrée cache hit¥0,02¥0,05¥0,10~400 %
V4-Flash entrée cache miss¥1,0¥1,5¥3,0200 %
V4-Flash sortie¥2,0¥4,5¥9,0350 %
V4-Pro entrée cache hit¥0,025¥0,15¥0,30~1100 %
V4-Pro entrée cache miss¥3,0¥4,5¥9,0200 %
V4-Pro sortie¥6,0¥13,5¥27,0350 %
Fait citable n°1 : Annonce officielle recoupée avec Wall Street CN, IT Home et V2EX. Les 1100 % portent sur l’entrée cache hit en pointe. La facture réelle bouge avec la sortie (+350 %) et l’entrée cache miss. Une charge lourde (environ 84 M de tokens/mois, surtout hors pointe, moitié de hits) se rapproche de 1,8×.

Qwen3.8-2.4T-A95B (poids ouverts de Qwen3.8-Max)

SpécificationDétail
Paramètres2,4 billions au total, 95 milliards actifs (MoE, 512 experts, 10 routés + 1 partagé)
Contexte262 144 tokens natifs, extensible à ~1,01 M ; Max hébergé à 1 M par défaut
RythmeAperçu 2 août → API 3 août → poids 12 août
API internationale2 $ entrée / 6 $ sortie par million
Licencepas Apache 2.0 — Qwen3.8-Max License
Enjeupremier fleuron Max ouvert ; 3.5/3.6/3.7 Max restaient API

GLM-5.3 face à GLM-5.2 : même base, post-entraînement seul. Chiffres Zhipu, pas de rejeu tiers publié.

BancGLM-5.2GLM-5.3Écart
Terminal-Bench 3.04,6 %28,3 %+23,7
DeepSWE v1.146,2 %66,9 %+20,7
Agents' Last Exam (CLI)23,8 %28,5 %+4,7
CyberGym77,2 %84,5 %+7,3
AutomationBench26,2 %48,2 %+22,0
Fait citable n°2 : Terminal-Bench 3.0 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %). Premier peloton ouvert, pas un sacre frontalier. API Qwen internationale : 2 $ / 6 $.

02Trois stratégies, trois logiques

DeepSeek : du tarif plat au tarif horaire, une pénurie de calcul rendue lisible. Lire « pression de marge » est trop simple. La structure ressemble à une première facture de capacité. L’ancien prix unique achetait des utilisateurs tant que les GPU suivaient. Quand le trafic explose, « encourager une planification plus souple » veut dire : le calcul de pointe manque, décalez-vous.

Détail souvent omis hors Chine : en pointe, l’API officielle dépasse déjà GMI Cloud, Novita et d’autres revendeurs. L’hypothèse « l’officiel est toujours le moins cher » tombe.

Alibaba : les poids achètent l’écosystème, la licence maison protège le plafond. Le checkpoint 2,4 billions se télécharge, la licence n’est pas Apache 2.0. Un MaaS ou un assistant de travail IA à plus de 50 millions de dollars sur 12 mois doit négocier à part. Un produit à plus de 100 millions d’actifs mensuels ou 20 millions de dollars de revenu mensuel doit afficher le nom du modèle.

Donner les poids pour rassurer les acheteurs étrangers, garder le levier sur les quelques acteurs capables d’en faire un métier d’inférence : ce n’est pas le même « ouvert » que Muse Glimmer sous Apache 2.0 sans clause. La rumeur d’interdiction USA, UE, Royaume-Uni, Corée est fausse ; le texte n’a aucune clause territoriale.

GLM-5.3 : pas de nouvelle base, un pari de post-entraînement plus large. L’intérêt n’est pas le score, c’est la méthode : même base 743 milliards, pas de pré-entraînement repris, Terminal-Bench 3.0 de 4,6 % à 28,3 % (environ 6×) par mise à l’échelle des environnements RL. Quand la loi d’échelle du pré-entraînement s’essouffle, le RL de post-entraînement devient un levier moins cher qu’une nouvelle fondation.

Fait citable n°3 : Seuils de licence 50 M$ / 12 mois (MaaS, assistant) et 100 M MAU ou 20 M$ / mois (nom visible). GLM-5.3 Terminal-Bench 3.0 : 4,6 % → 28,3 %.

03Comparatif : DeepSeek reste-t-il le fleuron le moins cher ?

ModèleEntrée / 1 M tokensSortie / 1 M tokensPoids ouverts
DeepSeek V4-Pro (pointe)¥9,0 (~1,26 $)¥27,0 (~3,78 $)non
DeepSeek V4-Pro (hors pointe)¥4,5 (~0,63 $)¥13,5 (~1,89 $)non
Qwen3.8-Max (API internationale)2 $6 $oui (licence maison)
OpenAI GPT-5.6 Luna0,20 $1,20 $non
Claude Opus 5 (ratio Alibaba)~5 $~25 $non

Change approximatif ¥7,15 / 1 $. Hors pointe, V4-Pro reste nettement sous Claude Opus 5, mais n’est plus le plancher du marché. Qwen international et Luna passent sous DeepSeek hors pointe. « Modèle chinois = moins cher » tenait en 2025 et début 2026 ; ce n’est plus une hypothèse sûre.

04Points contestés ou non vérifiés

  • Le titre « 1100 % » est exact et trompeur sans contexte. Il ne vise que l’entrée cache hit en pointe. La sortie, qui pèse sur les vraies factures, monte de 350 %.
  • L’inférence sur puces Zhenwu M890 circule dans la presse financière chinoise, sans document technique Alibaba indépendant ni banc tiers. À traiter comme non vérifié.
  • La « faille grave Cursor » trouvée par GLM-5.3 vient de VentureBeat et de Zhipu. Les détails techniques manquent ; divulgation unilatérale.
  • Des contrôles d’export de représailles du ministère du Commerce restent des rumours médiatiques, pas un communiqué officiel.

05Contexte : deux guerres de prix en parallèle

Depuis environ un mois, les labos de tête chinois livrent à un rythme que la presse financière intérieure appelle « trois mises à jour par semaine » — DeepSeek, Alibaba, Zhipu, plus Kimi K3 (16 juillet, 2,8 billions) et MiniMax H3. Le cadrage chinois : les poids ouverts forcent une re-tarification mondiale.

Les labos américains font l’inverse côté grand public : OpenAI baisse de 80 % le 30 juillet puis rend le modèle gratuit et illimité une semaine plus tard ; Google livre le 13 août un modèle orienté code à la moitié du prix de son prédécesseur de trois semaines. La Chine ouvre des fleurons et étage le haut de gamme ; les États-Unis cassent le bas de l’entonnoir. Deux stratégies réelles, deux étages.

La couche géopolitique : Kimi K3 a déjà attiré un regard de sécurité américain ; le choix d’Alibaba d’ouvrir 2,4 billions dans cette fenêtre est lu par certains analystes comme un ancrage d’influence et de « parité technique » avant un possible resserrement. Interprétation, pas fait établi — mais un contexte que la presse tech anglophone découpe souvent en notes produit isolées.

06Six étapes avant la prochaine facture

  1. 01
    Découper le trafic aux fenêtres de Pékin. 9–12 h et 14–18 h contre le reste. La journée américaine tombe surtout hors pointe ; les jours ouvrés chinois tombent en pointe.
  2. 02
    Mesurer le taux de cache hit à part. Les 1100 % portent sur l’entrée hit. La facture bouge avec la sortie 350 % et le miss 200 %. Charge lourde vers 1,8×.
  3. 03
    Aligner officiel, revendeur, Qwen et Luna. En pointe : liste DeepSeek, GMI Cloud / Novita, Qwen 2 $/6 $, Luna 0,20 $/1,20 $. Abandonner « l’officiel est le moins cher ».
  4. 04
    Lire la LICENSE avant de télécharger. Usage personnel et interne peu touché. 50 M$ / 12 mois en MaaS ou assistant exigent une licence séparée. 100 M MAU ou 20 M$ / mois exigent le nom du modèle. Pas d’interdiction géographique.
  5. 05
    Traiter GLM-5.3 comme une montée de post-entraînement. Base 743 milliards. Terminal-Bench 3.0 reste derrière Sol 34,6 % et Fable 5 33,7 %. Pas de « n°1 ouvert » avant un rejeu indépendant.
  6. 06
    Héberger les évaluations sur un plan dédié. Un checkpoint 2,4 billions, des lots hors pointe et la reproduction des bancs GLM demandent des processus stables et une frontière de locataire. Estimer l’Apple Silicon / Mac cloud sur la page tarifs, tester l’inférence hors ligne via la page commande, décider à l’aune du taux d’interruption.
Liste minimale de la semaine de hausse
[ ] Trafic découpé pointe / hors pointe Pékin
[ ] Taux de hit et tokens de sortie séparés
[ ] Pointe officielle vs revendeur vs Qwen vs Luna
[ ] Seuils Qwen3.8-Max License lus
[ ] GLM-5.3 : chiffres vendeur, tiers en attente
[ ] Plan auto-hébergé isolé des secrets de prod

07Clôture et FAQ

DeepSeek inscrit une pénurie dans la grille. Alibaba échange des poids de fleuron contre de l’attention et garde une licence maison sur la couche qui encaisse. Zhipu montre qu’une échelle de post-entraînement déplace les bancs de code sans nouvelle base. Les pools à la minute, les VPS surbookés et le Mac sous le bureau échouent de la même façon : gigue, voisins, sessions longues coupées, plus d’audit des lots hors pointe. Pour un plan de production et d’évaluation plus stable, les nœuds Mac bare-metal / Mac cloud NUKCLOUD multi-régions offrent de l’Apple Silicon dédié et une frontière de locataire nette. Comparer sur la page tarifs, essayer via la page commande.

DeepSeek est-il plus cher que GPT-5.6 ou Claude après la hausse ?
Hors pointe, il reste sous Claude Opus 5, mais n’est plus le moins cher toutes catégories. Luna (0,20 $/1,20 $) et Qwen international (2 $/6 $) passent sous le nouveau hors pointe sur au moins un axe. Pour un modèle de frontière, DeepSeek reste relativement abordable, plus le plancher inconditionnel.
Puis-je utiliser gratuitement les poids Qwen3.8-Max dans un produit commercial ?
Oui pour l’essentiel : projets personnels et usage interne. Le verrou ne s’applique que si vous vendez un MaaS ou un assistant IA à plus de 50 millions de dollars sur 12 mois consécutifs ; il faut alors une licence Alibaba séparée.
Les utilisateurs des États-Unis, de l’UE ou du Royaume-Uni sont-ils exclus ?
Non. Cette rumeur est fausse. La licence publiée n’a aucune restriction géographique. Les limites tiennent au chiffre d’affaires, pas au lieu.
Quelle est la vraie différence entre GLM-5.3 et 5.2 ?
Aucune au niveau de la base : 743 milliards des deux côtés. Le saut d’environ 6× sur Terminal-Bench 3.0 vient uniquement de l’élargissement des environnements RL en post-entraînement, sans re-pré-entraînement.
Meta ouvrira-t-il vraiment le fleuron, pas seulement Muse Glimmer ?
Pas encore. Glimmer est un distillat 30 milliards. Zuckerberg a annoncé des poids « bientôt » pour Muse Spark 1.2, encore fermé. À la date de cet article, la sortie n’a pas eu lieu ; intention déclarée, pas fait.

Sources : annonce tarifaire DeepSeek (recoupée Wall Street CN, IT Home, AIGC.cn, V2EX) ; dépôts officiels Qwen (Hugging Face / ModelScope) et SCMP sur la licence ; page technique Z.ai GLM-5.3, VentureBeat et StableLearn ; blog Meta AI Research et VentureBeat sur Muse Glimmer ; Yicai et Sohu Finance sur le rythme des sorties. Prix, licence et bancs au moment de la publication. Revérifier les pages officielles avant republication. Puces nationales, faille Cursor et rumeurs d’export restent non confirmées.