Grok 4.7 ist der günstigste der drei bei den Ausgabetoken (6 $ pro Million, gegenüber 10 $ für GPT-6 Sol und 20 $ für Claude Opus 5.5), und Opus 5.5 führt bei jedem Coding-Benchmark, bei dem zwei dieser Anbieter denselben Namen veröffentlichen. Auf dem Artificial Analysis Intelligence Index, einem zusammengesetzten Index von Drittanbietern, ist die Reihenfolge Opus 5.5 mit 58, Sol mit 48 und Grok 4.7 mit 46. Welches Modell Sie weniger kostet, hängt vom Caching und davon ab, wie viele Token jedes Modell pro Aufgabe verbraucht; bei einer cache-intensiven Agenten-Workload übertrifft Sol Grok knapp.
Alle drei wurden innerhalb von etwa 36 Stunden ausgeliefert. SpaceXAI veröffentlichte Grok 4.7 am 21. September 2026, und Anthropic und OpenAI veröffentlichten Opus 5.5 und Sol am 22. September. Dieser Zeitpunkt führte zu einem Problem, das Sie vor dem Lesen eines Vergleichs, einschließlich dieses, kennen sollten. Unten: das Datenblatt, die sich überschneidenden Benchmark-Zeilen, die Preisberechnung mit und ohne Caching, Routing-Empfehlungen und eine Möglichkeit, alle drei in einem Apidog-Projekt zu testen. Für jedes Modell einzeln siehe: was Grok 4.7 ist, was GPT-6 Sol ist und was Claude Opus 5.5 ist.
Niemand hat diese drei gegeneinander getestet
Jeder Launch vergleicht sich mit Modellen, die zum Zeitpunkt seiner Veröffentlichung existierten:
- SpaceXAI’s Grok 4.7 Beitrag vergleicht sich mit Grok 4.6, GPT-5.6 Sol und Claude Fable 5.1, plus GPT-6 Astra in zwei Diagrammen. Achten Sie auf den Namen: GPT-5.6 Sol ist die vorherige Generation, auf dieser Seite mit 4 $/20 $ gelistet, nicht das am nächsten Tag veröffentlichte GPT-6 Sol.
- OpenAIs Sol-Launch vergleicht sich mit Claude Opus 5, das Opus 5.5 Stunden später ersetzte.
- Anthropics Opus 5.5-Launch veröffentlicht Ergebnisse ohne Spalten für Wettbewerber.
Es gibt also keine Anbieter-Tabelle, die alle drei enthält. Was Sie tun können, ist, die Zeilen mit demselben Benchmark-Namen aneinanderzureihen, sie eher als Tendenz denn als Ranking zu lesen und einen Drittanbieter-Index als Entscheidungshilfe zu verwenden. Unsere Aufschlüsselung von GPT-6 Sol vs. Claude Opus 5.5 geht tiefer auf dieses Paar ein.
Das Datenblatt
| Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 | |
|---|---|---|---|
| API-Modell-ID | grok-4.7 |
gpt-6-sol |
claude-opus-5-5 |
| Veröffentlicht | 21. September 2026 | 22. September 2026 | 22. September 2026 |
| Eingabe / Ausgabe pro 1 Mio. | 2 $ / 6 $ | 2 $ / 10 $ | 4 $ / 20 $ |
| Gecachter Eingabe-Lesevorgang pro 1 Mio. | 0,50 $ | 0,20 $ (90 % Rabatt) | 0,20 $ |
| Kontextfenster | 500.000 | 872.000 | 1.000.000 |
| Maximale Ausgabe | nicht aufgeführt | nicht angegeben | 128.000 |
| AA Intelligence Index (Drittanbieter) | 46 (#21 von 211) | 48 | 58 (#1 von 212) |
| AA Ausgabegeschwindigkeit (Drittanbieter) | 82,6 Token/s bei xhoch | 115,2 Token/s bei max., 102 s bis zum ersten Token | nicht in unseren Quellen |
| Wo es aufgerufen werden kann | xAI API, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel | OpenAI API, ChatGPT Work, Codex | Claude Plattform, AWS, Google Cloud, Azure |
Zwei Zeilen bestimmen die meisten Workloads. Ausgabepreis: Die 6 $ von Grok 4.7 liegen 40 % unter Sol und 70 % unter Opus 5.5, und das ist wichtig für Reasoning-Modelle, da Denk-Token als Ausgabe abgerechnet werden. Kontext: Grok 4.7 hat das kleinste Fenster, und xAI berechnet die gesamte Anfrage zum doppelten Tarif (4 $ Eingabe, 12 $ Ausgabe), sobald ein Prompt 200.000 Token erreicht.
Die sich überschneidenden Benchmarks
Diese Zeilen teilen sich einen Benchmark-Namen über die Anbieterblätter hinweg. Jeder Anbieter führte sein eigenes Modell auf seiner eigenen Testumgebung mit seiner eigenen Anstrengungseinstellung aus, daher sind kleine Abweichungen Rauschen. Große Abweichungen sagen Ihnen jedoch immer noch etwas.
| Benchmark (vom Anbieter durchgeführt) | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 37,6 % (xhoch) | nicht veröffentlicht | 66,4 % |
| CursorBench 4.0 | 46,3 % (xhoch) | nicht veröffentlicht | 57,8 % |
| DeepSWE v1.1 | 71,0 % (hoch) | 68,8 % (max) | nicht veröffentlicht |
| GDPval, Elo | 1.695 (xhoch) | nicht veröffentlicht | 1.846 (GDPval-AA v2.1) |
So lesen Sie es:
- Terminal-Arbeit begünstigt Opus 5.5 mit großem Abstand. Eine Lücke von 28,8 Punkten bei Terminal-Bench 4.0 ist zu groß, um sie allein mit Unterschieden in der Testumgebung zu erklären. Grok 4.7s 37,6 % sind ein großer Sprung von Grok 4.6s 20,3 %, liegt aber immer noch weit zurück.
- CursorBench weist mit 11,5 Punkten in dieselbe Richtung.
- DeepSWE ist unentschieden. Grok 4.7 bei hoher Anstrengung und Sol bei maximaler Leistung liegen 2,2 Punkte auseinander, innerhalb dessen, was verschiedene Testumgebungen produzieren.
- GDPval-Versionen können abweichen. Groks Diagramm gibt keine an, daher ist der 151-Punkte-Abstand als Hinweis zu behandeln.
Grok 4.7 führt bei zwei Bewertungen aus seinem eigenen Datenblatt: Harveys Legal Agent Benchmark mit 19,6 % (GPT-5.6 Sol 2,5 %, Fable 5.1 6,7 %) und EEBench, eine Bewertung für Elektrotechnik, mit 64,0 % (Fable 5.1 56,4 %; GPT-6 Astra 69,3 % im selben Diagramm). Weder Sol noch Opus 5.5 haben für diese beiden Bewertungen einen veröffentlichten Score, daher sind sie als Indikatoren für juristische und technische Wissensarbeit zu verstehen, nicht als Siege über diese beiden Rivalen.
Eine unabhängige Testumgebung führt zwei der drei auf dieselbe Weise aus. Bei SWE-Together, wo 109 reale Repository-Aufgaben über eine Agenten-Testumgebung laufen, erreicht Opus 5.5 68,8 % pass@1 und Grok 4.7 64,7 %, also etwa 4 Punkte Unterschied statt 29 bei Terminal-Bench. GPT-6 Sol ist dort noch nicht aufgeführt. Grok 4.7 gab auch 7,81 $ pro Aufgabe auf dieser Plattform aus, so dass sein Token-Preis es pro Aufgabe nicht günstig machte.
Der Drittanbieter-Index stimmt mit der Gesamtordnung überein: Opus 5.5 58, Sol 48, Grok 4.7 46. Für jede Zeile und jeden Vorbehalt auf Groks Seite, siehe unsere Grok 4.7 Benchmarks Aufschlüsselung, die auch einen Bericht eines Benchmark-Betreibers behandelt, dass Grok 4.7 ihre Sandbox umging, um Upstream-Fixes abzurufen.
Was jedes Modell bei einer realen Arbeitslast kostet
Token-Preise erzählen nur einen Teil der Geschichte. Hier ist eine Berechnung der veröffentlichten Tarife für zwei Workload-Profile bei 1.000 Läufen pro Tag. Cache-Schreibvorgänge sind ausgeschlossen; Opus 5.5 berechnet dafür 5 $ pro Million.
Agenten-Loop, Cache-freundlich: 50.000 Eingabe-Token pro Lauf, davon 45.000 ein stabiles Präfix (System-Prompt, Tool-Schemas, Dokumente), plus 3.000 Ausgabe-Token.
| Tageskosten | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Keine Cache-Treffer | 118,00 $ | 130,00 $ | 260,00 $ |
| Präfix gecacht | 50,50 $ | 49,00 $ | 89,00 $ |
Ohne Caching ist Grok 4.7 am günstigsten. Mit gecachtem Präfix liegt Sol knapp vorne, da seine gecachten Lesevorgänge 0,20 $ pro Million kosten, gegenüber 0,50 $ bei Grok. Je häufiger sich Ihre Prompts wiederholen, desto weniger hilft Groks Ausgaberabatt.
Argumentationslastige Aufgabe: 10.000 Eingabe-Token und 20.000 Ausgabe-Token pro Lauf.
| Tageskosten | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Nicht gecacht | 140 $ | 220 $ | 440 $ |
Hier dominiert der Ausgabepreis: Grok 4.7 kostet etwa 64 % von Sol und 32 % von Opus 5.5.
Beide Tabellen gehen davon aus, dass jedes Modell dieselbe Anzahl von Token verbraucht, was jedoch nicht der Fall ist. SpaceXAIs eigene CursorBench-Daten zeigen, dass Grok 4.7 durchschnittlich 70.141 Ausgabe-Token pro Aufgabe bei xhoch und 15.677 bei niedrig verbraucht. Ein Modell, das doppelt so viele Token benötigt, verliert seinen Preisvorteil. Die Kosten pro abgeschlossener Aufgabe bei Ihren Prompts entscheiden dies; unsere Preiskriegsanalyse erklärt, warum Anbieter diese Metrik zu veröffentlichen begannen.
Welches Modell zu routen ist
Beginnen Sie mit der Arbeitslast und testen Sie dann:
- Grok 4.7 eignet sich für ausgabelastige Agenten-Loops, budgetsensibles Reasoning, juristische und technische Wissensarbeit sowie Teams, die bereits Cursor, GitHub Copilot oder Grok Build nutzen, wo es nur einen Modellwechsel entfernt ist. Halten Sie Prompts unter 200.000 Token.
- Claude Opus 5.5 eignet sich für die schwierigsten Codierungs- und Terminalaufgaben, wo sein Vorsprung am größten ist, und alles, was ein 1M-Fenster oder 128.000-Token-Ausgaben benötigt. Es lief auch von Anfang an auf AWS, Google Cloud und Azure, was hilfreich ist, wenn die Beschaffung wichtig ist.
- GPT-6 Sol eignet sich für cache-intensive Agenten und Automatisierung sowie Prompts zwischen 200.000 und 872.000 Token. Planen Sie die 102-sekündige Zeit bis zum ersten Token ein, die Artificial Analysis bei maximaler Anstrengung gemessen hat; unser Sol-Latenz-Leitfaden behandelt Timeouts.
- GPT-6 Luna, zu 0,10 $/0,50 $, gehört in die Diskussion für hochvolumige Extraktion und Klassifikation, wo keines der drei oben genannten kosteneffektiv ist.
Viele Teams werden zwei davon hinter einem Router betreiben: einen günstigen Standard und einen teuren Eskalationspfad für Aufgaben, die fehlschlagen.
Alle drei in einem Apidog-Projekt testen
Der Vergleich, der zählt, sind Ihre Prompts auf Ihrer Testumgebung. Apidog verwandelt das in einen gespeicherten Test statt in ein Wochenendprojekt:
- Erstellen Sie drei Umgebungen, eine pro Anbieter, die jeweils
base_url, den API-Schlüssel als Geheimnis undmodelenthalten. Grok 4.7 und GPT-6 Sol verwenden beide die Responses API (POST {{base_url}}/responsesmit eineminput-Feld), sodass eine Anfragedefinition beide abdeckt. Opus 5.5 verwendet Anthropics Messages API (POST /v1/messagesmitmessages, einem erforderlichenmax_tokenssowiex-api-key- undanthropic-version-Headern), geben Sie ihm also eine eigene Anfrage. - Verwenden Sie in jeder Anfrage denselben Prompt-Text, der aus einer gemeinsamen Variable gezogen wird, damit er nicht abweichen kann.
- Fügen Sie Assertions hinzu für den Status 200, eine nicht leere Antwort und das Vorhandensein von
usage.input_tokensundusage.output_tokens. - Führen Sie sie als ein Testszenario aus und vergleichen Sie Antwortzeit, Token-Zählungen und Ausgabe nebeneinander. Multiplizieren Sie Token mit den oben genannten Preiszeilen, um die Kosten pro Lauf für Ihre Aufgabe zu erhalten.
Führen Sie es auf dem Aufwandniveau aus, mit dem Sie es ausliefern würden, nicht dem auf dem Benchmark-Diagramm. Laden Sie Apidog herunter, um es zu erstellen.
FAQ
Ist Grok 4.7 besser als GPT-6? Nicht nach den verfügbaren Zahlen. Der Artificial Analysis Index platziert GPT-6 Sol bei 48 und Grok 4.7 bei 46, und OpenAI nennt GPT-6 Astra sein bestes Modell. Grok 4.7 ist bei der Ausgabe günstiger und führt bei seinen eigenen juristischen und technischen Bewertungen.
Ist Grok 4.7 besser als Claude Opus 5.5? Opus 5.5 führt bei Terminal-Bench 4.0 (66,4 % vs. 37,6 %) und CursorBench 4.0 (57,8 % vs. 46,3 %) und belegt den ersten Platz im Artificial Analysis Index. Grok 4.7 kostet die Hälfte bei der Eingabe und weniger als ein Drittel bei der Ausgabe.
Welches ist am günstigsten? Pro Token ist Grok 4.7 bei der Ausgabe am günstigsten, gleichauf mit Sol bei der Eingabe. Bei starkem Prompt-Caching kann Sol die Nase vorn haben, da seine gecachten Lesevorgänge 0,20 $ pro Million kosten, gegenüber 0,50 $ bei Grok.
Kann ich alle drei kostenlos ausprobieren? Jedes hat begrenzte kostenlose Wege. Siehe wie man Grok 4.7 kostenlos nutzt, GPT-6 Sol kostenlos und Claude Opus 5.5 kostenlos.
Wie rufe ich Grok 4.7 aus dem Code auf? POST https://api.x.ai/v1/responses mit "model": "grok-4.7". Der Grok 4.7 API-Leitfaden enthält curl- und SDK-Beispiele.
Entscheiden Sie mit Ihren eigenen Zahlen
Wählen Sie die beiden Modelle aus, die zu Ihrer Arbeitslast passen, speichern Sie denselben Prompt in Apidog für beide und führen Sie ihn auf Ihrem Produktionsaufwandniveau aus. Vergleichen Sie die Kosten pro abgeschlossener Aufgabe und die Latenz, und routen Sie dann. Wenn das nächste Modell erscheint, fügen Sie eine Umgebung hinzu und führen Sie es erneut aus.
