Drei Schritte in fünf Tagen wirken widersprüchlich und gehören zusammen. DeepSeek hebt einzelne API-Positionen um bis zu 1100 % an. Alibaba legt im selben Fenster erstmals Qwen-Max-Gewichte mit 2,4 Billionen Parametern offen. Zhipu liefert GLM-5.3 auf der 743-Milliarden-Basis von GLM-5.2 und holt den Coding-Sprung fast nur aus dem Nachtraining. Chinesische Flaggschiffe konkurrieren nicht mehr nur um den niedrigsten Listenpreis, sondern um Preissetzungsmacht. Zur Produktgeschichte siehe Qwen3.8-Max-Start und V4-Flash-Review; hier folgen Gewichte, Zeitpreise und der gleiche-Basis-Sprung.
00Zeitlinie der zwei Wochen
| Datum | Ereignis |
|---|---|
| 16. Juli 2026 | Moonshot AI legt Kimi K3 (2,8 Bio. Parameter) offen; zuvor bereits US-Sicherheitsinteresse |
| 2.–3. August | Alibaba kündigt Qwen3.8-Max an und schaltet die Cloud-API frei |
| 10. August | Meta veröffentlicht Muse Glimmer (30 Mrd., Apache 2.0) und kündigt Gewichte für Muse Spark 1.2 an |
| 12. August | Alibaba stellt Qwen3.8-2.4T-A95B auf ModelScope/Hugging Face; xAI liefert Grok 4.6 |
| 13. August | DeepSeek-V4-Pro GA plus Preisanhebung ab 17. August; Google senkt Gemini 3.7 Flash |
| 14. August | Zhipu liefert GLM-5.3 auf der 743-Mrd.-Basis von GLM-5.2 |
| 17. August, 00:00 Peking | Neue DeepSeek-Preise gelten |
Weiter zurück: Am 30. Juli senkte OpenAI die günstigste Stufe GPT-5.6 Luna um 80 %, am 6.–7. August wurde Luna Standard für Gratisnutzer mit unbegrenztem Text. Während chinesische Labore Preise anheben und Flaggschiffgewichte öffnen, senken US-Labore und machen die Konsumschicht kostenlos. Das ist dieselbe Preisauseinandersetzung von zwei Seiten. Zur Luna-Senkung: GPT-5.6-Preisnotiz.
FehlerTypische Fehlschlüsse in der Beschaffung
- 1100 % als ganze Rechnung lesen. 11×, 1100 % und 350 % können alle stimmen. Sie treffen Cache-Hit-Input, Output und Cache-Miss-Input.
- Offizielle API immer als billigste annehmen. In der Spitze liegen Reseller wie GMI Cloud und Novita unter dem offiziellen Peak.
- Open Weights mit Apache 2.0 gleichsetzen. Qwen3.8-Max nutzt die eigene Qwen3.8-Max License. Große MaaS-/KI-Assistenten brauchen eine Extra-Lizenz.
- Das Geo-Verbot wiederholen. Der Text enthält keine Territorialklausel. Grenzen sind Umsatz und Namensnennung.
- GLM-5.3 als neues Fundament führen. 743 Mrd. Parameter bleiben. Der Sprung ist Nachtraining, die Zahlen sind Herstellerwerte.
- Budget mit „China = billigste“ schreiben. Off-Peak-DeepSeek unterbietet Claude Opus 5 weiter, Qwen International und Luna unterbieten DeepSeek mindestens in einer Achse.
01Kennzahlen
DeepSeek-Preise ab 17. August, 00:00 Peking. Peak: 9–12 und 14–18 Uhr Peking. Einheit: je 1 Mio. Tokens.
| Position | Alt | Off-Peak neu | Peak neu | Peak-Anstieg |
|---|---|---|---|---|
| V4-Flash Cache-Hit Input | ¥0,02 | ¥0,05 | ¥0,10 | ca. 400 % |
| V4-Flash Cache-Miss Input | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash Output | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro Cache-Hit Input | ¥0,025 | ¥0,15 | ¥0,30 | ca. 1100 % |
| V4-Pro Cache-Miss Input | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro Output | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Qwen3.8-2.4T-A95B (offene Max-Gewichte)
| Merkmal | Wert |
|---|---|
| Parameter | 2,4 Bio. gesamt, 95 Mrd. aktiv (MoE, 512 Experten, 10 geroutet + 1 geteilt) |
| Kontext | 262 144 Tokens nativ, erweiterbar auf ca. 1,01 Mio.; Cloud-Max standard 1 Mio. |
| Takt | 2. Aug. Vorschau → 3. Aug. API → 12. Aug. Gewichte |
| Internationale API | $2 Input / $6 Output je Mio. Tokens |
| Lizenz | nicht Apache 2.0, eigene Qwen3.8-Max License |
| Bedeutung | erstes offenes Max-Flaggschiff; 3.5/3.6/3.7 Max blieben API-only |
GLM-5.3 gegen GLM-5.2: gleiche Basis, nur Nachtraining. Herstellerwerte, keine unabhängige Wiederholung.
| Benchmark | GLM-5.2 | GLM-5.3 | Delta |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 |
| CyberGym | 77,2 % | 84,5 % | +7,3 |
| AutomationBench | 26,2 % | 48,2 % | +22,0 |
02Drei Strategien, drei Logiken
DeepSeek: von der Flattarif-Tiefpreisung zur Tageszeitstaffel. Der einfache Lesefehler ist Margendruck. Die Struktur liest sich als erste sichtbare Compute-Knappheit. Der alte Einheitspreis kaufte Nutzer, solange GPU-Kapazität mithielt. Bei exponentiellem Traffic übersetzt „flexiblere Lastplanung“ in: Peak-Compute ist knapp, verschieben Sie selbst.
International oft übersehen: In der Spitze liegt die offizielle API über GMI Cloud, Novita und anderen. „Offiziell immer am günstigsten“ gilt nicht mehr.
Alibaba: Gewichte für das Ökosystem, eigene Lizenz für die Umsatzdecke. Der 2,4-Bio.-Checkpoint ist frei ladbar, die Lizenz ist nicht Apache 2.0. MaaS- oder KI-Arbeitsassistenten mit über 50 Mio. USD Umsatz in 12 Monaten brauchen eine Extra-Lizenz. Produkte mit über 100 Mio. MAU oder 20 Mio. USD Monatsumsatz müssen den Modellnamen sichtbar führen.
Ziel: internationale Entwickler holen, Preishebel bei wenigen Inferenzen-Großkunden behalten. Muse Glimmer unter uneingeschränktem Apache 2.0 ist ein anderes „offen“. Das Gerücht eines Downloadverbots für USA, EU, UK und Südkorea ist falsch; der Text hat keine Geoklausel.
GLM-5.3: kein neues Fundament, größeres Nachtraining. Relevant ist das Verfahren: gleiche 743-Mrd.-Basis, kein erneutes Pretraining, Terminal-Bench 3.0 von 4,6 % auf 28,3 % (rund 6×) durch skalierte RL-Umgebungen. Wenn Pretraining-Skalierung abflacht, wird Nachtraining-RL zur günstigeren Leistungshebel – auch für mittlere Labore.
03Vergleich: bleibt DeepSeek das günstigste Flaggschiff?
| Modell | Input / 1 Mio. Tokens | Output / 1 Mio. Tokens | Offene Gewichte |
|---|---|---|---|
| DeepSeek V4-Pro (Peak) | ¥9,0 (ca. $1,26) | ¥27,0 (ca. $3,78) | nein |
| DeepSeek V4-Pro (Off-Peak) | ¥4,5 (ca. $0,63) | ¥13,5 (ca. $1,89) | nein |
| Qwen3.8-Max (international) | $2 | $6 | ja (eigene Lizenz) |
| OpenAI GPT-5.6 Luna | $0,20 | $1,20 | nein |
| Claude Opus 5 (Alibaba-Vielfaches) | ca. $5 | ca. $25 | nein |
Umrechnung ca. ¥7,15/$1. Off-Peak-V4-Pro bleibt klar unter Claude Opus 5, ist aber nicht mehr das Feldminimum. Qwen International und Luna unterbieten DeepSeek Off-Peak. „Chinesisches Modell = billigstes Modell“ war 2025 und Anfang 2026 tragfähig, heute nicht mehr.
04Strittig und ungeprüft
- Die 1100-%-Schlagzeile ist fachlich korrekt und ohne Kontext irreführend. Sie gilt nur für Peak-Cache-Hit-Input. Output stieg um 350 %.
- Zhenwu-M890-Inferenz erscheint in chinesischen Finanzmedien, fehlt in unabhängigen Alibaba-Papieren und Drittbenchmarks. Als nicht unabhängig geprüft führen.
- „Schwere Cursor-Lücke“ durch GLM-5.3 stammt von VentureBeat und Zhipu. Details fehlen; einseitige Herstellerangabe.
- Vergeltungs-Exportkontrollen des Handelsministeriums sind unbestätigte Medienberichte, keine amtliche Mitteilung.
05Kontext: zwei Preiskriege parallel
Seit etwa einem Monat liefern chinesische Spitzenlabore in einem Takt, den Inlandmedien „drei Modellupdates pro Woche“ nennen – DeepSeek, Alibaba, Zhipu plus Kimi K3 (16. Juli, 2,8 Bio.) und MiniMax H3. Die chinesische Rahmung lautet: offene Gewichte erzwingen eine globale Neubepreisung.
US-Labore fahren die Gegenseite auf der Konsumschicht: OpenAI senkte am 30. Juli um 80 % und machte das Modell eine Woche später frei und unbegrenzt; Google lieferte am 13. August ein Coding-Modell zum halben Preis des drei Wochen alten Vorgängers. China öffnet Flaggschiffe und staffelt oben, die USA verbilligen unten. Beides sind Strategien, nur andere Trichterstufen.
Die geopolitische Schicht: Kimi K3 zog bereits US-Sicherheitsprüfung an; Alibabas Fenster für 2,4 Bio. wird von manchen Analysten als Sicherung internationaler Sichtbarkeit vor möglicher Regulierungsenge gelesen. Das ist Interpretation, kein Beleg – aber Kontext, den englischsprachige Produktnotizen oft abschneiden.
06Sechs Schritte vor der nächsten Rechnung
-
01
Traffic nach Peking-Peak teilen. 9–12 und 14–18 Uhr Peking gegen den Rest. US-Tagesarbeit fällt meist Off-Peak, chinesische Werktage treffen Peak.
-
02
Cache-Hit-Rate als eigene KPI. 1100 % sitzt auf Hit-Input. Rechnungstreiber sind Output 350 % und Miss-Input 200 %. Schwere Last näher 1,8×.
-
03
Offiziell, Reseller, Qwen, Luna in eine Tabelle. Peak: DeepSeek-Liste, GMI Cloud/Novita, Qwen $2/$6, Luna $0,20/$1,20. „Offiziell billigste“ streichen.
-
04
LICENSE vor dem Download lesen. Privat und intern bleiben weitgehend frei. 50 Mio. USD / 12 Monate MaaS oder Assistent brauchen Extra-Lizenz. 100 Mio. MAU oder 20 Mio. USD Monatsumsatz erzwingen Namensnennung. Kein Geoverbot.
-
05
GLM-5.3 als Nachtraining führen. Basis 743 Mrd. Terminal-Bench 3.0 hinter Sol 34,6 % und Fable 5 33,7 %. Kein „Open-Weight-Eins“ vor Drittmessung.
-
06
Selbsthost-Evals auf dediziertem Host. 2,4-Bio.-Checkpoint, Off-Peak-Batches und GLM-Nachtrainingsbenches brauchen stabile Prozesse und Mandantengrenze. Kosten auf der Preisseite schätzen, Offline-Inferenz über die Bestellseite testen, nach Unterbrechungsrate skalieren.
[ ] Traffic nach Peking Peak / Off-Peak
[ ] Hit-Rate und Output-Tokens getrennt
[ ] Offizieller Peak vs. Reseller vs. Qwen vs. Luna
[ ] Qwen3.8-Max-Lizenzschwellen gelesen
[ ] GLM-5.3: Herstellerwerte, Dritte ausstehend
[ ] Selbsthost-Ebene von Produktionsgeheimnissen getrennt
07Schluss und FAQ
DeepSeek schreibt Knappheit in die Preisliste. Alibaba tauscht Flaggschiffgewichte gegen Reichweite und hält die eigene Lizenz über die Cash-Schicht. Zhipu zeigt, dass Nachtrainingsskala Coding-Benches ohne neues Fundament bewegt. Geteilte Minutenpools, überverkaufte VPS und ein Mac unter dem Schreibtisch scheitern gleich: Jitter, Nachbarn, abgerissene Langsitzungen zerstören Off-Peak-Batches und lokale Auditspuren. Für eine stabilere Produktions- und Bewertungsfläche liefern NUKCLOUD-Bare-Metal-Mac- und Cloud-Mac-Knoten in mehreren Regionen dediziertes Apple Silicon und eine klare Mandantengrenze. SKUs auf der Preisseite, Test über die Bestellseite.
Quellen: DeepSeek-Preisbekanntmachung (Abgleich Wall Street CN, IT Home, AIGC.cn, V2EX); Qwen-Repos auf Hugging Face/ModelScope und SCMP zur Lizenz; Z.ai-Technikseite zu GLM-5.3 sowie VentureBeat/StableLearn; Meta-AI-Research-Blog und VentureBeat zu Muse Glimmer; Yicai und Sohu Finance zum Veröffentlichungstakt. Preise, Lizenz und Benches zum Veröffentlichungsstand. Vor Weitergabe offizielle Seiten prüfen. Chip-Claims, Cursor-Lücke und Exportgerüchte bleiben ungeprüft.