Als xAI Grok 4.5 am 8. Juli 2026 auslieferte, wählte Elon Musk den Vergleich selbst: „ein Modell der Opus-Klasse, aber schneller, token-effizienter und kostengünstiger.“ Das ist eine spezifische, überprüfbare Behauptung über Claude Opus 4.8, Anthropic's bewährtes Codierungsmodell.
Also, überprüfen wir das. Dieser Vergleich verwendet die von xAI in seiner Ankündigung veröffentlichten Zahlen, die von Anthropic veröffentlichten Preise und die Teile der Geschichte, die keiner der Anbieter in eine Überschrift packt. Die Kurzversion: Die Behauptung trifft größtenteils zu, mit zwei Benchmark-Verlusten und einem großen Sternchen bezüglich der Überprüfung.
Die Scorecard
xAI veröffentlichte vier Coding-Benchmarks. Hier sind sie, mit beiden Modellen plus dem Kontext des aktuellen Stands der Technik:
| Benchmark | Grok 4.5 | Opus 4.8 (max) | Gewinner |
|---|---|---|---|
| DeepSWE 1.0 (pass@1) | 62.0% | 55.75% | Grok 4.5 (+6.25) |
| DeepSWE 1.1 | 53% | 59% | Opus 4.8 (+6) |
| Terminal Bench 2.1 | 83.3% | 78.9% | Grok 4.5 (+4.4) |
| SWE Bench Pro (resolve) | 64.7% | 69.2% | Opus 4.8 (+4.5) |
Zwei Siege für jeden. Auf den eigenen Diagrammen von xAI ist „Opus-Klasse“ als Fähigkeitsstufe zutreffend und als Anspruch auf Überlegenheit falsch, was – zu xAIs Ehren – nicht die Behauptung ist, die Musk aufgestellt hat.

Bemerkenswert: Claude Fable 5 (max) führt alle vier dieser Diagramme an (66.1 / 70 / 84.3 / 80.4), und GPT 5.5 (xhigh) schlägt beide Modelle bei drei der vier. Grok 4.5 konkurriert in der Stufe unterhalb der Spitze, gegen das Modell, das Anthropic für die tägliche Arbeit und nicht für die Spitzenleistung bepreist. Wenn Sie den Kampf an der Spitze sehen wollen, dann ist das Fable 5 gegen Opus 4.8.
Das Herkunfts-Sternchen
Dies sind keine unabhängigen Testergebnisse. xAI merkt an, dass die Zahlen der Konkurrenten aus „den veröffentlichten Systemkarten oder Benchmark-Bestenlisten der jeweiligen Entwickler“ stammen, wobei die DeepSWE-Evaluierungen von Datacurve erstellt und die Läufe mit dem jeweiligen Provider-Harness durchgeführt wurden. Das ist besser als undurchsichtige Selbstdarstellung, aber das Mischen von Quellen bedeutet, dass Unterschiede bei Harness und Gerüst in den Vergleich einfließen. Noch keine vollständig unabhängige dritte Partei hat Grok 4.5 bewertet. Unser tiefgehender Einblick in Benchmarks verfolgt diese Situation.
Preis: Grok gewinnt auf dem Papier, in der Praxis noch deutlicher
Listenpreise pro Million Tokens:
| Grok 4.5 | Opus 4.8 | |
|---|---|---|
| Eingabe | $2.00 | $5.00 |
| Ausgabe | $6.00 | $25.00 |
Das sind 40% des Eingabepreises von Opus und 24% seines Ausgabepreises. (Alle Details von Anthropic finden Sie in unserer Opus 4.8 Preisübersicht.)
Die Lücke vergrößert sich, wenn man die Ausführlichkeit berücksichtigt. xAI berichtet, dass Grok 4.5 SWE Bench Pro-Aufgaben mit durchschnittlich 15.954 Output-Tokens löst; Opus 4.8 (max) erreicht bei demselben Benchmark durchschnittlich 67.020. Multipliziert man dies pro gelöster Aufgabe:
- Grok 4.5: 15.954 Tokens × $6/M ≈ $0.10 Ausgabe pro Aufgabe
- Opus 4.8 (max): 67.020 Tokens × $25/M ≈ $1.68 Ausgabe pro Aufgabe
Etwa 17-mal günstiger bei der Ausgabe pro erledigter Aufgabe, gemäß den vom Anbieter gemeldeten Token-Anzahlen. Die genaue Multiplikation ist mit Vorsicht zu genießen (ein Benchmark, eine Messung des Anbieters und der „Max“-Anstrengungsmodus bläht die Token-Anzahl von Opus auf), aber die Tendenz ist schwer zu leugnen: Ein wortkarges Modell für 6 US-Dollar schlägt ein wortreiches Modell für 25 US-Dollar um mehr, als die Preisliste vermuten lässt. Ausführlichere Szenarien stellen wir in Grok 4.5 Preisgestaltung erklärt dar.
Der Vorbehalt gilt auch umgekehrt: Opus verliert teilweise mehr Tokens pro Aufgabe, weil der „Max“-Modus ausführlich argumentiert, und diese Argumentation ist ein Grund, warum es SWE Bench Pro um 4,5 Punkte gewinnt. Man bezahlt für das Denken. Manchmal ist das Denken das Produkt.
Geschwindigkeit: 80 TPS und kürzere Antworten addieren sich
Grok 4.5 liefert etwa 80 Tokens pro Sekunde, was xAI als „Geschwindigkeit schneller Modelle“ bezeichnet. In Kombination mit Ausgaben, die ein Viertel der Länge betragen, verkürzt sich die Wall-Clock-Zeit pro Aufgabe doppelt: weniger Tokens, schneller geliefert. Bei Agenten-Loops, die Dutzende von Modellaufrufen verketten, addiert sich die Latenz pro Schritt zu gesparten Minuten pro Sitzung.
Anthropic veröffentlicht keine vergleichbare TPS-Zahl für Opus 4.8, und die realen Geschwindigkeiten variieren je nach Last und Stufe. Messen Sie dies also anhand Ihres eigenen Traffics, anstatt sich auf die Marketingseite eines der Anbieter zu verlassen.
Wo Opus 4.8 die Oberhand behält
Der Preis ist nicht alles, und die Scorecard nennt die Bereiche, in denen dies nicht der Fall ist:
- Die anspruchsvollste Agenten-Codierung. SWE Bench Pro, der dem unübersichtlichen Repo-Arbeitsalltag am nächsten kommt, geht an Opus mit 4,5 Punkten. DeepSWE 1.1, die neuere Revision, geht an Opus mit 6.
- Reife des Ökosystems. Opus 4.8 fügt sich in Claude Code, etablierte Tool-Nutzungsmuster und ein Jahr Produktionshärtung ein. Grok 4.5 wurde gestern eingeführt; seine Integrationsfläche ist Grok Build, Cursor und eine frische API. Migrationskosten sind real, auch wenn die Kosten pro Token niedriger sind.
- Vorhersagbarkeit. Das Verhalten von Opus unter langen Kontexten, seine Ablehnungsmuster und seine Fehlermodi sind gut dokumentiert, auch von uns. Die von Grok 4.5 sind erst eine Woche alt.
Welches sollten Sie verwenden?
Wählen Sie Grok 4.5, wenn Ihre Arbeitslast hochvolumige agentische Codierung oder Wissensarbeit ist, Ihre API-Rechnung ein Posten ist, den Sie beobachten, und eine 2-von-4-Benchmark-Aufteilung zu einem Viertel des Ausgabepreises wie Arbitrage klingt. Die Einführungspreise plus die aktuellen kostenlosen Zeitfenster machen das Ausprobieren in diesem Monat nahezu kostenlos.
Bleiben Sie bei Opus 4.8, wenn Sie tief im Anthropic-Ökosystem verwurzelt sind, die stärksten veröffentlichten Ergebnisse bei anspruchsvollen Benchmarks auf Repo-Ebene in dieser Preisklasse benötigen oder das Risiko eines Modells in der ersten Woche in der Produktion nicht akzeptieren können.
Messen Sie es so oder so selbst. Beide APIs sprechen OpenAI-kompatible Formate, daher ist ein A/B-Harness günstig zu erstellen. Speichern Sie in Apidog eine Anfrage pro Modell, richten Sie diese auf Ihre fünf schwierigsten echten Prompts und vergleichen Sie Ausgabequalität, Latenz und das Nutzungsobjekt nebeneinander. Prüfen Sie insbesondere output_tokens: Wenn Groks Antworten auf Ihre Prompts nicht kürzer sind, gelten die oben genannten wirtschaftlichen Vorteile für Sie nicht. Laden Sie Apidog kostenlos herunter und führen Sie den Vergleich mit Ihrem eigenen Traffic durch, bevor Sie eine Arbeitslast verschieben.
Einrichtungsanleitungen für beide Seiten: wie man die Grok 4.5 API verwendet und wie man die Claude Opus 4.8 API verwendet.
FAQ
Ist Grok 4.5 besser als Claude Opus 4.8? Sie teilten xAIs veröffentlichte Benchmarks 2 zu 2. Grok 4.5 ist günstiger und token-effizienter; Opus 4.8 gewinnt die beiden schwierigeren Evals auf Repo-Ebene. „Besser“ hängt davon ab, ob Ihr Engpass das Budget oder die Spitzenleistung ist.
Wie viel günstiger ist Grok 4.5 als Opus 4.8? 2 US-Dollar gegenüber 5 US-Dollar pro Million Eingabe-Tokens und 6 US-Dollar gegenüber 25 US-Dollar pro Million Ausgabe-Tokens. Pro gelöster Coding-Aufgabe deuten die vom Anbieter gemeldeten Token-Anzahlen auf eine wesentlich größere effektive Lücke hin.
Gibt es unabhängige Benchmarks für Grok 4.5? Noch nicht. Die veröffentlichten Zahlen mischen xAIs Läufe, Datacurve-Evaluierungen und Systemkarten anderer Anbieter. Unabhängige Zahlen sollten innerhalb weniger Wochen nach dem Start vorliegen.
Kann ich beide Modelle mit demselben Code testen? Meistens ja. Beide stellen OpenAI-kompatible Chat-Vervollständigungen bereit, sodass das Austauschen von base_url, Schlüssel und Modell-ID die Grundlagen abdeckt. Details zu Tool-Aufrufen und strukturierten Ausgaben unterscheiden sich; testen Sie diese Pfade explizit, bevor Sie wechseln.
