Grok 4.6 ist xAIs bahnbrechendes Sprachmodell, das am 12. August 2026 veröffentlicht wurde. Es baut auf Grok 4.5 auf und konzentriert sich auf langlaufende Agenten, agentische Programmierung sowie interaktive oder visuelle Arbeiten. Es bietet ein Kontextfenster von 500.000 Tokens zu 2 $ pro Million Eingabetokens und 6 $ pro Million Ausgabetokens. Im Artificial Analysis Intelligenz-Index erreicht es 61 Punkte, liegt damit gleichauf mit OpenAIs GPT-5.6 Sol und einen Punkt hinter Anthropics Claude Fable 5, was es zum derzeit günstigsten Modell an der Spitze der Intelligenz macht.
Das ist die Antwort in einem Absatz. Der Rest dieses Beitrags behandelt, was sich tatsächlich von Grok 4.5 geändert hat, was die Benchmark-Zahlen bedeuten, wo Sie das Modell heute verwenden können und was es für Sie bedeutet, wenn Sie gegen LLM-APIs entwickeln. Wenn Letzteres auf Sie zutrifft, bietet Ihnen Apidog einen kostenlosen Arbeitsbereich zum Entwerfen, Testen und Simulieren von LLM-API-Aufrufen, praktisch, um Grok 4.6 auf Herz und Nieren zu prüfen, ohne zuerst einen Client schreiben zu müssen.
Das Wichtigste in Kürze
- Veröffentlicht: 12. August 2026, von xAI.
- Fokus: Agenten mit langem Planungshorizont, mehrstufiges Codieren, interaktive und visuelle Arbeiten. xAI sagt, das Modell testet und verifiziert seine eigene Arbeit häufiger, bevor es fortfährt.
- Spezifikationen: 500K Kontextfenster, Wissensstand bis 1. Februar 2026.
- Preise: 2 $ / 1M Eingabe, 6 $ / 1M Ausgabe. Eine schnellere Variante kostet das Doppelte. In der ersten Woche ist die doppelte Nutzung in Grok Build und Cursor enthalten.
- Benchmarks: Intelligenz-Index 61 (gleichauf mit GPT-5.6 Sol), große Sprünge im Vergleich zu 4.5 bei DeepSWE (54 → 65.9) und APEX-Agents (47.1 → 57.5).
- Wo es verwendet werden kann: xAI API, Grok Build, Cursor, OpenRouter, Vercel und Cloudflare.
Grok 4.6 auf einen Blick
| Spezifikation | Grok 4.6 |
|---|---|
| Entwickler | xAI |
| Veröffentlichungsdatum | 12. August 2026 |
| Kontextfenster | 500.000 Tokens |
| Wissensstand | 1. Februar 2026 |
| Preis Eingabe / Ausgabe | 2 $ / 6 $ pro 1M Tokens |
| Schnelle Variante | 2x Preis |
| Intelligenz-Index | 61 (GPT-5.6 Sol: 61, Claude Fable 5: 62) |
| Verfügbarkeit | xAI API, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
Was ist wirklich neu im Vergleich zu Grok 4.5
Grok 4.6 ist keine Offenlegung der Architektur, sondern eine Trainingsgeschichte. Laut xAI durchlief das Modell einen längeren ergänzenden Trainingslauf als Grok 4.5, wobei drei Zutaten die Hauptarbeit leisteten:
- Kuratierte, vom Modell generierte Daten, die auf Schlussfolgerung und fortgeschrittene technische Konzepte abzielen.
- Hochwertige Engineering-Datensätze, die die codeintensive „Diät“ fortsetzen, die begann, als xAI mit dem Training anhand realer Entwicklungssitzungen anfing.
- Ein verbesserter Optimierer und ein Trainingsrezept, bei dem überwachte Fine-Tuning-Trajektorien über Schlussfolgerungs- und domänenspezifische Bereiche neu generiert wurden.
Die Verhaltensänderung, die Entwickler bemerken werden, ist die Selbstverifikation. Bei langen Agentenläufen überprüft Grok 4.6 seine eigene Arbeit, bevor es zum nächsten Schritt übergeht, den gerade geschriebenen Test ausführt, die gerade bearbeitete Datei erneut liest, anstatt auf einer unbestätigten Annahme voranzuschreiten. xAI berichtet auch von stärkeren ersten Versuchen bei interaktiven und visuellen Projekten: Dashboards, kleine Anwendungen und UI-Arbeiten kommen beim ersten Durchlauf näher an die Nutzbarkeit heran.
Wenn Sie der Trainingsansatz von Grok 4.5 interessiert hat, deckt unsere Aufschlüsselung, was das Cursor-Sitzungstraining für Entwickler bedeutete, die Abstammungslinie ab, auf der dieses Modell aufbaut.
Die Benchmarks mit relevanten Unterschieden
Zahlen zur Markteinführung von Anbietern verdienen Skepsis, aber die Unterschiede von 4.5 zu 4.6 sind groß genug, um aussagekräftig zu sein. Hier ist das Bild, einschließlich des Stands der Konkurrenz:

Drei wichtige Erkenntnisse:
- Die Agenten-Lücke schloss sich. Der 10,4-Punkte-Sprung bei APEX-Agents bewegt Grok von „deutlich im Rückstand“ auf 1,7 Punkte an Fable 5 Max heran und leicht vor GPT-5.6 Sol Max (56,7 %).
- Repository-übergreifendes Codieren verbesserte sich am meisten. Ein Anstieg von DeepSWE um fast 12 Punkte ist der Unterschied zwischen einem Modell, das bei Änderungen über mehrere Dateien stolpert, und einem, das mithalten kann, obwohl Sol Max diese Benchmark immer noch mit großem Vorsprung anführt.
- Unabhängige Zahlen untermauern die Aussage. Artificial Analysis maß durchschnittliche Kosten von 0,84 $ pro Aufgabe in seinen Agenten-Evaluierungen, die niedrigsten unter den Modellen der Spitzengruppe, und einen Elo-Wert von 1753 auf GDPval-AA v2 für professionelle Wissensarbeit.
Für Kontext, wie die Benchmark-Veröffentlichungen von xAI zu lesen sind, und die Einschränkungen, die auch für die letzte Generation galten, siehe unsere Grok 4.5 Benchmarks-Analyse.
Preise: Das Preis-Leistungs-Verhältnis an der Spitze
Grok 4.6 behält die Preise von Grok 4.5 bei: 2 $ pro Million Eingabetokens, 6 $ pro Million Ausgabetokens. Im Vergleich zu den Modellen, mit denen es jetzt verglichen wird, ist das eine deutliche Spanne:
| Modell | Ausgabepreis / 1M Tokens |
|---|---|
| Grok 4.6 | 6 $ |
| Claude Opus 4.8 | 25 $ |
| GPT-5.6 Sol | 30 $ |
Das ist ein 5-facher Unterschied bei der Ausgabe im Vergleich zu GPT-5.6 Sol für ein Modell, das im zusammengesetzten Intelligenz-Index gleichauf liegt. Günstige Tokens bedeuten nicht automatisch günstige Aufgaben; ein schwächerer Durchlauf, der Überprüfung und Reparatur erfordert, kostet mehr als seine Token-Rechnung, aber die unabhängigen Daten zu den Kosten pro Aufgabe legen nahe, dass die Effizienz real ist, nicht nur ein niedriger Listenpreis.
Die schnellere Variante zum doppelten Preis (4 $/12 $) ist auf latenzempfindliche interaktive Nutzung ausgelegt. Und bis zum 19. August erhalten Grok Build- und Cursor-Benutzer die doppelte Nutzung, um das Modell zu testen.
Wo Sie Grok 4.6 heute nutzen können
- xAI API über console.x.ai, OpenAI-kompatibel. Unser Grok 4.5 API-Leitfaden ist direkt anwendbar; ändern Sie einfach den Modellnamen.
- Cursor, als Modelloption verfügbar; Cursor veröffentlichte eigene Startnotizen parallel zu denen von xAI.
- Grok Build, xAIs eigener Agenten-Arbeitsbereich, mit dem 2x Nutzungsbonus zur Startwoche.
- OpenRouter, Vercel und Cloudflare, für Teams, die mehrere Modelle über ein einziges Gateway leiten; auf OpenRouter als
x-ai/grok-4.6gelistet.
Es gibt hier keine separate Verbrauchereinführung zu entwirren: Dies ist eine Entwickler-zentrierte Veröffentlichung, und der schnellste Weg, sie zu evaluieren, ist über die API oder eine IDE, die sie bereits integriert hat.
Einschränkungen und offene Fragen
Eine Bewertung in der Startwoche schuldet Ihnen die Vorbehalte neben den Schlagzeilenzahlen:
- Die Benchmarks sind größtenteils vom Anbieter gemeldet. Artificial Analysis hat unabhängige Werte veröffentlicht, die weitgehend übereinstimmen, aber die spezifischen Codierungszahlen (DeepSWE, FrontierCode, CursorBench) stammen aus xAIs eigener Starttabelle. Die Startzahlen von Grok 4.5 hielten nur teilweise unabhängigen Tests stand; gehen Sie auch hier von einer gewissen Regression zum Mittelwert aus.
- Das Kontextfenster ist das kleinste an der Spitze. 500K Tokens decken die meisten realen Arbeitslasten ab, aber GPT-5.6 Sol bietet 1,05M und Claude Fable 5 bietet 1M. Wenn Sie ganze Monorepos oder riesige Dokumentsätze in einem Aufruf verarbeiten, ist dieser Unterschied wesentlich.
- Sol führt immer noch dort, wo es am schwierigsten ist. Das 7-Punkte DeepSWE-Defizit bedeutet, dass vollständig autonome Arbeit über große bestehende Codebasen hinweg bei GPT-5.6 Sol Max stärker bleibt, und das ist die wirtschaftlich wertvollste Agenten-Arbeitslast.
- Die Reife des Ökosystems hinkt hinterher. Batch-Verarbeitung, Prompt-Caching-Schichten und Nutzungssteuerungen auf der xAI-Plattform sind jünger als die Äquivalente von OpenAI und Anthropic. Die OpenAI-Kompatibilität überbrückt das meiste davon, aber nicht alles.
Keines davon ist disqualifizierend. Sie definieren, wo Grok 4.6 passt: die Preis-Leistungs-Option, die Sie ernsthaft bewerten sollten, nicht die Standardeinstellung, die Sie aufgrund des Rufs übernehmen.
Was es für API-Entwickler bedeutet
Die strategische Deutung: Die Spitze hat jetzt einen echten Preiswettbewerber. Bis zu dieser Veröffentlichung bedeutete das Erreichen von Ergebnissen auf GPT-5.6 Sol-Niveau, 25–30 $ pro Million Ausgabetokens zu zahlen. Grok 4.6 erledigt dies für 6 $, was die Rechnung insbesondere bei Agenten-Schleifen ändert; ein Agent, der 40 Modellaufrufe pro Aufgabe tätigt, spürt einen 5-fachen Ausgabepreisunterschied sofort.
Praktisch bedeutet die OpenAI-kompatible API, dass die Bewertung einen Nachmittag, nicht einen Sprint, kostet. Richten Sie Ihren bestehenden Client auf https://api.x.ai/v1, führen Sie Ihre echte Arbeitslast dagegen aus und vergleichen Sie. Richten Sie diesen Vergleich in Apidog ein und Sie können GPT-5.6-, Claude- und Grok 4.6-Anfragen nebeneinander in einem Projekt verwalten, mit Umgebungen pro Anbieter und Zusicherungen zur Überprüfung der Ausgabequalität, Token-Nutzung und Latenz über alle drei hinweg – nützliche Beweise, bevor Sie eine Produktionsarbeitslast einem von ihnen anvertrauen.
Der Agenten-Fokus des Modells erhöht auch die Anforderungen an die Korrektheit von Tool-Aufrufen. Wenn Ihre Grok-Integration Funktionsaufrufe beinhaltet, testen Sie die von ihm generierten Payloads, nicht nur den von ihm geschriebenen Text.
Häufig gestellte Fragen
Was ist Grok 4.6 in einem Satz? xAIs bahnbrechendes Modell vom August 2026, optimiert für langlaufende Agenten und Codierung, mit einem 500K Kontextfenster und Benchmark-Ergebnissen der Spitzenklasse zu etwa einem Fünftel des Ausgabepreises der Konkurrenz.
Ist Grok 4.6 besser als GPT-5.6? Sie liegen auf dem Artificial Analysis Intelligenz-Index mit 61 Punkten gleichauf. GPT-5.6 Sol Max führt beim Codieren auf Repository-Ebene (DeepSWE); Grok 4.6 liegt bei APEX-Agents leicht vorne und kostet etwa 5x weniger pro Ausgabetoken.
Was ist der Unterschied zwischen Grok 4.5 und 4.6? Gleicher Preis, gleiche API, deutlich besseres Modell: +11,9 Punkte bei DeepSWE, +10,4 bei APEX-Agents und eine neue Tendenz zur Selbstverifikation bei langen Aufgaben.
Kann ich Grok 4.6 kostenlos testen? Grok Build und Cursor beinhalten die doppelte Nutzung während der Startwoche, und die Methoden in unserem Leitfaden zur kostenlosen Nutzung von Grok 4.5 übertragen sich weitgehend auf 4.6.
