Kurzfassung: Die gesamte Grok-4.6/4.7-Roadmap stützt sich auf einen einzigen Musk-X-Post — nicht auf eine xAI-Ankündigung. Hält der Zeitplan, würde xAI in rund zwei Monaten drei Frontier-Modelle ausliefern und Grok 4.6 in dasselbe August-Fenster wie Kimi K3s Open-Weight-Schock und Gerüchte um Claude Fable 5.1 legen. Am selben Tag unterschrieben 1.100+ Mitarbeiter den Brief „Pacing the Frontier" — xAI fehlte auf der Liste. Unten: Zeitachse, Spec-Tabellen, SFT/RL-Einordnung, Wettbewerbsmatrix, Schmerzpunkte für Engineering-Teams, Sechs-Schritte-Runbook und FAQ.
00Zeitachse: Von Grok 4.5 zu 4.6 und 4.7 in unter zwei Monaten
| Datum | Ereignis |
|---|---|
| 8. Juli 2026 | xAI liefert Grok 4.5 — Cursor-Co-Training, 500K Kontext, 2/6 USD pro M Tokens, Model Card mit 15 Benchmarks |
| 16.–27. Juli 2026 | Moonshot AI startet Kimi K3 als Service, veröffentlicht danach 2,8T Open Weights auf Hugging Face |
| 28. Juli 2026 | Musk antwortet @rauchg: Grok 4.6 (~7. Aug.), Grok 4.7 (wenige Wochen später) — einzige öffentliche Quelle für beide Modelle |
| 28. Juli 2026 | 1.100+ Beschäftigte bei OpenAI, Anthropic, Google und Meta unterzeichnen „Pacing the Frontier"; OpenAI und Anthropic auf Unternehmensebene — xAI nicht dabei |
| ~7. August 2026 (Ziel) | Grok 4.6 — 1,5T Parameter, Fokus SFT/RL |
| Ende Aug.–Anfang Sep. 2026 (geschätzt) | Grok 4.7 — 2,1T Parameter; Musk: besser als 4.6, etwas langsameres Serving, höhere Token-Effizienz |
01Kerndaten: Bekannt vs. angekündigt
| Modell | Datum | Parameter | Schwerpunkt | Status |
|---|---|---|---|---|
| Grok 4.3 Beta | 17. Apr. 2026 | Nicht offengelegt | Vorgänger-Baseline | Ausgeliefert |
| Grok 4.5 | 8. Juli 2026 | Nicht offengelegt | Coding/Agentic, Cursor-Co-Training | Ausgeliefert, benchmarked |
| Grok 4.6 | ~7. Aug. 2026 | 1,5T | SFT/RL-Upgrade | Nur Tweet, unveröffentlicht |
| Grok 4.7 | ~Ende Aug. | 2,1T | Breites Upgrade über 4.6, bessere Token-Effizienz | Nur Tweet, unveröffentlicht |
Grok 4.5 kam mit Model Card, 15 Benchmarks und API-Preisen. Für Grok 4.6 gibt es null unabhängige Evaluationsdaten. Parameterzahlen und Post-Training-Claims sind Vendor-Aussagen aus einem X-Post, bis xAI anderes veröffentlicht.
PainWarum August-Modellplanung gerade weh tut
- Single-Source-Roadmap-Risiko: Der Beschaffungskalender hängt an einem Tweet, nicht an einer xAI-Produktseite. Teams, die August-Sprints auf Grok 4.6 ausrichten, haben weder SLA noch Beta-Zugang noch Plan B bei Verzögerung.
- Komprimierte Flaggschiff-Halbwertszeit: Grok 4.5 erschien am 8. Juli. Landet 4.6 am 7. August, ist das Modell möglicherweise schon eine Generation alt, bevor Benchmarks den Migrationsaufwand rechtfertigen.
- Benchmark-Vakuum: Grok 4.5 lieferte SWE-Bench Pro (64,7 %), Terminal Bench 2.1 (83,3 %) und Token-Effizienz. Für 4.6 fehlt alles. Ein verantwortungsvoller Bake-off gegen Kimi K3 (93,4 % SWE-bench Verified) oder GPT-5.6 Sol (96,2 %) auf Glauben allein ist nicht möglich.
- Dual-SKU-Verwirrung: Musk skizzierte 4.6 (1,5T, schneller) und 4.7 (2,1T, langsameres Serving, bessere Token-Effizienz) im selben Post. Teams müssen entscheiden, ob sie auf das „schnellere" oder „bessere" Modell warten — ohne Preisdelta oder API-Model-IDs.
- Vendor-Safety-Haftung: Im Juli 2026 verklagte xAI einen Nutzer wegen mutmaßlicher CSAM-Generierung mit Grok — implizites Eingeständnis, dass Schutzmechanismen umgangen werden können. Ein Common-Sense-Media-Bericht von Januar 2026 stufte Grok unter die schlechtesten Chatbots für Kinderschutz ein.
- August-Release-Stau: Gerüchte um Claude Fable 5.1, Kimi K3s Open-Weight-Schock und Altmans GPT-6-Lobbying im Weißen Haus konvergieren im selben Fenster — Evaluationsbandbreite wird zum Engpass, nicht das GPU-Budget.
02Warum xAI auf SFT und RL setzt, nicht nur auf Skalierung
Musk betonte für Grok 4.6 „deutlich verbessertes SFT & RL" statt bloßer Parameterwachstums. Das folgt dem Grok-4.5-Muster: Co-Training auf echten Cursor-Entwicklersessions erzeugte einen 4,2× Token-Effizienz-Vorsprung auf SWE-Bench Pro (15.954 vs. 67.020 Tokens bei Opus 4.8), ohne jede Intelligence-Leaderboard-Spitze.
SFT und RL verständlich
Supervised Fine-Tuning (SFT) formt Verhalten mit kuratierten Beispielen. Reinforcement Learning (RL) nutzt Belohnungssignale, damit das Modell erfolgreiche mehrstufige Aktionsketten lernt — entscheidend für Agent-Workflows, bei denen ein falscher Tool-Call die Kette bricht.
Die Dual-SKU-Strategie
Grok 4.6 mit 1,5T ist ein spürbarer Skalierungssprung. Musks Framing von 4.7 — größer, „in fast allem besser, etwas langsameres Serving" — deutet auf bewusste Trennung latenz- und qualitätssensitiver Workloads, analog zu Sonnet/Opus oder mini/full-Tiers.
Der Kimi-K3-Druck
Grok 4.6s Zieldatum liegt rund zehn Tage nach Kimi K3s vollem Open-Weight-Release. K3 dominierte Frontend Code Arena mit 1.679 Punkten — erstes Open-Weight-Modell, das dort alle Closed Models schlägt. Musk nannte K3 in Benchmark-Threads „beeindruckend". Die komprimierte xAI-Kadenz liest sich als Wettbewerbsantwort.
03Frontier-Vergleich: Grok 4.6 im August-Feld
| Modell | Anbieter | Parameter | Kontext | Preis (Input/Output pro 1M) | Quelle |
|---|---|---|---|---|---|
| Grok 4.5 | xAI | Nicht offengelegt | 500K | 2 USD / 6 USD | xAI offiziell |
| Grok 4.6 (angekündigt) | xAI | 1,5T | Nicht offengelegt | Nicht offengelegt | Musk X-Post (unverifiziert) |
| Grok 4.7 (angekündigt) | xAI | 2,1T | Nicht offengelegt | Nicht offengelegt | Musk X-Post (unverifiziert) |
| Kimi K3 | Moonshot AI | 2,8T MoE (~104B aktiv) | 1M | 0,30 USD Cache Hit / 3 USD Miss in, 15 USD out | Moonshot + Hugging Face |
| Claude Fable 5.1 (Gerücht) | Anthropic | Nicht offengelegt | Nicht offengelegt | Gerücht 10 USD / 50 USD | 36kr, WinCentral — unbestätigt |
| GPT-5.6 Sol | OpenAI | Nicht offengelegt | Nicht offengelegt | Nicht offengelegt | OpenAI offiziell |
Verifizierte Benchmarks (nur ausgelieferte Modelle)
| Modell | SWE-bench Verified | Artificial Analysis Index | Status |
|---|---|---|---|
| Claude Opus 5 | 97 % | — | 24. Juli ausgeliefert |
| GPT-5.6 Sol | 96,2 % | 59 | 9. Juli ausgeliefert |
| Claude Fable 5 | 95 % | 60 | 9. Juni ausgeliefert |
| Kimi K3 | 93,4 % | ~57 (#3 global) | 16.–27. Juli ausgeliefert |
| Grok 4.5 | 64,7 % (SWE-Bench Pro) | 54 | 8. Juli ausgeliefert |
| Grok 4.6 | Keine Daten | Keine Daten | Unveröffentlicht |
Grok 4.5s Vorteil heute liegt in Ökonomie pro Aufgabe und Agent-Workflow-Abschluss — nicht im SWE-bench-Rang. Ob 4.6s SFT/RL-Push die 16–30-Punkte-Coding-Lücke schließt, ohne Token-Effizienz zu opfern, bleibt offen bis zum Launch.
04Pacing the Frontier, Safety-Klage und der August-Engpass
Der 28. Juli war ein Split-Screen-Tag. Während Musk die Grok-4.6/4.7-Roadmap postete, veröffentlichten über 1.100 Beschäftigte von OpenAI, Anthropic, Google DeepMind und Meta „Pacing the Frontier" — einen offenen Brief an die US-Regierung, Frontier-AI-Forschung gezielt zu verlangsamen. OpenAI und Anthropic stimmten auf Unternehmensebene zu. xAI fehlte.
In derselben Woche demonstrierte Altman ein unveröffentlichtes Modell (weithin als GPT-6 gelesen) im Weißen Haus nach dem Hugging-Face-Sandbox-Escape. Die Branche lobbyiert gleichzeitig für Verlangsamung und Rennsport — xAI steht fest in der Beschleunigungslager mit drei Frontier-Modellen in zwei Monaten.
August 2026 wird zum Release-Engpass. Hält Musks Zeitplan, landen Grok 4.6 und 4.7 im selben Monat wie Gerüchte um Claude Fable 5.1 und wenige Wochen nach Kimi K3s Open-Weight-Schock. Für Engineering-Teams schrumpft die Nutzungsdauer jedes Flaggschiffs auf Wochen — Token-Effizienz und Kosten pro Aufgabe werden zur haltbareren Auswahlgrundlage als reine Leaderboard-Ränge.
05Sechs-Schritte-Runbook vor Grok 4.6
- 01
- 02
-
03
Dual-SKU-Routing planen: 4.6 (schneller, 1,5T) vs. 4.7 (langsameres Serving, 2,1T, bessere Token-Effizienz). Routing-Policy jetzt skizzieren: latenzsensitive Agent-Loops auf 4.6, qualitätskritische Refactors auf 4.7 — vorbehaltlich Preisen.
-
04
48-Stunden-Bake-off-Vorlage bauen: 20–50 echte Repo-Aufgaben mit automatischem Scoring. Bei Grok-4.6-Release denselben Harness gegen Grok 4.5, K3 und Incumbent innerhalb von 48 Stunden fahren.
-
05
Vendor-Risk in Beschaffung einbeziehen: xAIs CSAM-Klage und Common-Sense-Media-Rating mit Legal/Compliance prüfen. Bei Minderjährigen oder regulierten Daten Sign-off vor Produktionstraffic auf Grok 4.6.
-
06
August-Budget, nicht August-Architektur: Agent-Pipelines nicht um unveröffentlichte Modelle umbauen. Grok 4.5 oder aktuellen Stack durch August in Produktion halten; Sandbox-Budget nur für 4.6-Evaluierung. Routing nach offiziellen Preisen und Model Card neu bewerten — und beobachten, ob Claude Fable 5.1 oder GPT-6 das Feld erneut verschiebt.
06Fazit: Auf Grok 4.6 warten?
Grok 4.6 ist plausibel — xAI hat Memphis-GPU-Cluster, Cursor-Partnerschaft und Druck durch Kimi K3. „Plausibel" ist aber nicht „bestätigt". Bis Model Card, Benchmarks und Preise da sind, ist Produktion auf den 7. August ein Musk-Zeit-Glücksspiel.
Der klügere Juli–August-2026-Play: weiter auf Grok 4.5 (wenn Token-Ökonomie passt), Kimi K3 (wenn Open-Weight-Flexibilität zählt) oder Incumbent Claude/GPT (wenn SWE-bench-Genauigkeit nicht verhandelbar ist). Das Runbook oben ermöglicht Sandbox-Evaluierung am Release-Tag — ohne Migration auf einen Tweet.
Agent-Evaluierung braucht stabile Infrastruktur. Teams mit 48-Stunden-Bake-offs über Grok-, Kimi- und Claude-APIs stoßen oft auf geteilte CI-Runner, Heim-Macs und instabile Long-Lived-Connections, die Latenz- und Token-Messungen verfälschen. Für dedizierte 24/7-Agent-Hosts mit auditierbaren Build-Planes und regionalen Primärpfaden passen NUKCLOUD multiregionale Bare-Metal-Mac-/Cloud-Mac-Knoten zu einer Multi-Modell-Routing-Strategie. Specs auf der Preisseite, Trial-Umgebung über Bestellung.
-
Wann erscheint Grok 4.6 genau?Musk nannte „etwa 7. August 2026" in einer X-Antwort an @rauchg vom 28. Juli. xAI hat kein offizielles Datum bestätigt. Planen Sie mit einem Zieltermin, der sich um Tage oder Wochen verschieben kann.
-
Was unterscheidet Grok 4.6 von Grok 4.7?Grok 4.6: 1,5T Parameter, Fokus SFT/RL. Grok 4.7, wenige Wochen später: 2,1T, laut Musk in fast allem besser, etwas langsameres Serving, bessere Token-Effizienz.
-
Schlägt Grok 4.6 Kimi K3 oder Claude Fable 5.1?Noch nicht beurteilbar. Kimi K3 hat verifizierte Scores inkl. Frontend Code Arena. Claude Fable 5.1 ist von Anthropic nicht bestätigt. Vergleich erst nach Release mit Model Card.
-
Was kostet Grok 4.6?Unbekannt. Grok 4.5 startete bei 2 USD/M Input und 6 USD/M Output — Referenzpunkt, aber keine 4.6-Preise von xAI.
-
Wo wird Grok 4.6 verfügbar sein?Nach Grok 4.5 wahrscheinlich zuerst Grok Build, xAI-API und xAI-Konsole, dann Drittplattformen wie Cursor — für 4.6 noch nicht bestätigt.
Stand 2026-07-30. Quellen: xAI Grok 4.5 Launch, Elon Musk X-Post 28. Juli 2026 (Antwort an @rauchg), Moonshot Kimi K3 Release, Emergent.sh / WinCentral / 36kr zu Claude Fable 5.1, The Verge / TechTimes zu Pacing the Frontier, Ars Technica / TechCrunch / The Guardian zu xAI Safety-Klage.