Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5: Preis, Benchmarks und Einsatzempfehlung

Grok 4.7 gegen GPT-6 Sol gegen Claude Opus 5.5: Preise, Kontext, die überlappenden Benchmarks, Berechnungscaching bei realen Arbeitslasten und welches man ansteuern sollte.

Ashley Innocent

Ashley Innocent

29 September 2026

Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5: Preis, Benchmarks und Einsatzempfehlung

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Grok 4.7 ist der günstigste der drei bei den Ausgabetoken (6 $ pro Million, gegenüber 10 $ für GPT-6 Sol und 20 $ für Claude Opus 5.5), und Opus 5.5 führt bei jedem Coding-Benchmark, bei dem zwei dieser Anbieter denselben Namen veröffentlichen. Auf dem Artificial Analysis Intelligence Index, einem zusammengesetzten Index von Drittanbietern, ist die Reihenfolge Opus 5.5 mit 58, Sol mit 48 und Grok 4.7 mit 46. Welches Modell Sie weniger kostet, hängt vom Caching und davon ab, wie viele Token jedes Modell pro Aufgabe verbraucht; bei einer cache-intensiven Agenten-Workload übertrifft Sol Grok knapp.

Button

Alle drei wurden innerhalb von etwa 36 Stunden ausgeliefert. SpaceXAI veröffentlichte Grok 4.7 am 21. September 2026, und Anthropic und OpenAI veröffentlichten Opus 5.5 und Sol am 22. September. Dieser Zeitpunkt führte zu einem Problem, das Sie vor dem Lesen eines Vergleichs, einschließlich dieses, kennen sollten. Unten: das Datenblatt, die sich überschneidenden Benchmark-Zeilen, die Preisberechnung mit und ohne Caching, Routing-Empfehlungen und eine Möglichkeit, alle drei in einem Apidog-Projekt zu testen. Für jedes Modell einzeln siehe: was Grok 4.7 ist, was GPT-6 Sol ist und was Claude Opus 5.5 ist.

Niemand hat diese drei gegeneinander getestet

Jeder Launch vergleicht sich mit Modellen, die zum Zeitpunkt seiner Veröffentlichung existierten:

Es gibt also keine Anbieter-Tabelle, die alle drei enthält. Was Sie tun können, ist, die Zeilen mit demselben Benchmark-Namen aneinanderzureihen, sie eher als Tendenz denn als Ranking zu lesen und einen Drittanbieter-Index als Entscheidungshilfe zu verwenden. Unsere Aufschlüsselung von GPT-6 Sol vs. Claude Opus 5.5 geht tiefer auf dieses Paar ein.

Das Datenblatt

Grok 4.7 GPT-6 Sol Claude Opus 5.5
API-Modell-ID grok-4.7 gpt-6-sol claude-opus-5-5
Veröffentlicht 21. September 2026 22. September 2026 22. September 2026
Eingabe / Ausgabe pro 1 Mio. 2 $ / 6 $ 2 $ / 10 $ 4 $ / 20 $
Gecachter Eingabe-Lesevorgang pro 1 Mio. 0,50 $ 0,20 $ (90 % Rabatt) 0,20 $
Kontextfenster 500.000 872.000 1.000.000
Maximale Ausgabe nicht aufgeführt nicht angegeben 128.000
AA Intelligence Index (Drittanbieter) 46 (#21 von 211) 48 58 (#1 von 212)
AA Ausgabegeschwindigkeit (Drittanbieter) 82,6 Token/s bei xhoch 115,2 Token/s bei max., 102 s bis zum ersten Token nicht in unseren Quellen
Wo es aufgerufen werden kann xAI API, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel OpenAI API, ChatGPT Work, Codex Claude Plattform, AWS, Google Cloud, Azure

Zwei Zeilen bestimmen die meisten Workloads. Ausgabepreis: Die 6 $ von Grok 4.7 liegen 40 % unter Sol und 70 % unter Opus 5.5, und das ist wichtig für Reasoning-Modelle, da Denk-Token als Ausgabe abgerechnet werden. Kontext: Grok 4.7 hat das kleinste Fenster, und xAI berechnet die gesamte Anfrage zum doppelten Tarif (4 $ Eingabe, 12 $ Ausgabe), sobald ein Prompt 200.000 Token erreicht.

Die sich überschneidenden Benchmarks

Diese Zeilen teilen sich einen Benchmark-Namen über die Anbieterblätter hinweg. Jeder Anbieter führte sein eigenes Modell auf seiner eigenen Testumgebung mit seiner eigenen Anstrengungseinstellung aus, daher sind kleine Abweichungen Rauschen. Große Abweichungen sagen Ihnen jedoch immer noch etwas.

Benchmark (vom Anbieter durchgeführt) Grok 4.7 GPT-6 Sol Claude Opus 5.5
Terminal-Bench 4.0 37,6 % (xhoch) nicht veröffentlicht 66,4 %
CursorBench 4.0 46,3 % (xhoch) nicht veröffentlicht 57,8 %
DeepSWE v1.1 71,0 % (hoch) 68,8 % (max) nicht veröffentlicht
GDPval, Elo 1.695 (xhoch) nicht veröffentlicht 1.846 (GDPval-AA v2.1)

So lesen Sie es:

Grok 4.7 führt bei zwei Bewertungen aus seinem eigenen Datenblatt: Harveys Legal Agent Benchmark mit 19,6 % (GPT-5.6 Sol 2,5 %, Fable 5.1 6,7 %) und EEBench, eine Bewertung für Elektrotechnik, mit 64,0 % (Fable 5.1 56,4 %; GPT-6 Astra 69,3 % im selben Diagramm). Weder Sol noch Opus 5.5 haben für diese beiden Bewertungen einen veröffentlichten Score, daher sind sie als Indikatoren für juristische und technische Wissensarbeit zu verstehen, nicht als Siege über diese beiden Rivalen.

Eine unabhängige Testumgebung führt zwei der drei auf dieselbe Weise aus. Bei SWE-Together, wo 109 reale Repository-Aufgaben über eine Agenten-Testumgebung laufen, erreicht Opus 5.5 68,8 % pass@1 und Grok 4.7 64,7 %, also etwa 4 Punkte Unterschied statt 29 bei Terminal-Bench. GPT-6 Sol ist dort noch nicht aufgeführt. Grok 4.7 gab auch 7,81 $ pro Aufgabe auf dieser Plattform aus, so dass sein Token-Preis es pro Aufgabe nicht günstig machte.

Der Drittanbieter-Index stimmt mit der Gesamtordnung überein: Opus 5.5 58, Sol 48, Grok 4.7 46. Für jede Zeile und jeden Vorbehalt auf Groks Seite, siehe unsere Grok 4.7 Benchmarks Aufschlüsselung, die auch einen Bericht eines Benchmark-Betreibers behandelt, dass Grok 4.7 ihre Sandbox umging, um Upstream-Fixes abzurufen.

Was jedes Modell bei einer realen Arbeitslast kostet

Token-Preise erzählen nur einen Teil der Geschichte. Hier ist eine Berechnung der veröffentlichten Tarife für zwei Workload-Profile bei 1.000 Läufen pro Tag. Cache-Schreibvorgänge sind ausgeschlossen; Opus 5.5 berechnet dafür 5 $ pro Million.

Agenten-Loop, Cache-freundlich: 50.000 Eingabe-Token pro Lauf, davon 45.000 ein stabiles Präfix (System-Prompt, Tool-Schemas, Dokumente), plus 3.000 Ausgabe-Token.

Tageskosten Grok 4.7 GPT-6 Sol Claude Opus 5.5
Keine Cache-Treffer 118,00 $ 130,00 $ 260,00 $
Präfix gecacht 50,50 $ 49,00 $ 89,00 $

Ohne Caching ist Grok 4.7 am günstigsten. Mit gecachtem Präfix liegt Sol knapp vorne, da seine gecachten Lesevorgänge 0,20 $ pro Million kosten, gegenüber 0,50 $ bei Grok. Je häufiger sich Ihre Prompts wiederholen, desto weniger hilft Groks Ausgaberabatt.

Argumentationslastige Aufgabe: 10.000 Eingabe-Token und 20.000 Ausgabe-Token pro Lauf.

Tageskosten Grok 4.7 GPT-6 Sol Claude Opus 5.5
Nicht gecacht 140 $ 220 $ 440 $

Hier dominiert der Ausgabepreis: Grok 4.7 kostet etwa 64 % von Sol und 32 % von Opus 5.5.

Beide Tabellen gehen davon aus, dass jedes Modell dieselbe Anzahl von Token verbraucht, was jedoch nicht der Fall ist. SpaceXAIs eigene CursorBench-Daten zeigen, dass Grok 4.7 durchschnittlich 70.141 Ausgabe-Token pro Aufgabe bei xhoch und 15.677 bei niedrig verbraucht. Ein Modell, das doppelt so viele Token benötigt, verliert seinen Preisvorteil. Die Kosten pro abgeschlossener Aufgabe bei Ihren Prompts entscheiden dies; unsere Preiskriegsanalyse erklärt, warum Anbieter diese Metrik zu veröffentlichen begannen.

Welches Modell zu routen ist

Beginnen Sie mit der Arbeitslast und testen Sie dann:

Viele Teams werden zwei davon hinter einem Router betreiben: einen günstigen Standard und einen teuren Eskalationspfad für Aufgaben, die fehlschlagen.

Alle drei in einem Apidog-Projekt testen

Der Vergleich, der zählt, sind Ihre Prompts auf Ihrer Testumgebung. Apidog verwandelt das in einen gespeicherten Test statt in ein Wochenendprojekt:

  1. Erstellen Sie drei Umgebungen, eine pro Anbieter, die jeweils base_url, den API-Schlüssel als Geheimnis und model enthalten. Grok 4.7 und GPT-6 Sol verwenden beide die Responses API (POST {{base_url}}/responses mit einem input-Feld), sodass eine Anfragedefinition beide abdeckt. Opus 5.5 verwendet Anthropics Messages API (POST /v1/messages mit messages, einem erforderlichen max_tokens sowie x-api-key- und anthropic-version-Headern), geben Sie ihm also eine eigene Anfrage.
  2. Verwenden Sie in jeder Anfrage denselben Prompt-Text, der aus einer gemeinsamen Variable gezogen wird, damit er nicht abweichen kann.
  3. Fügen Sie Assertions hinzu für den Status 200, eine nicht leere Antwort und das Vorhandensein von usage.input_tokens und usage.output_tokens.
  4. Führen Sie sie als ein Testszenario aus und vergleichen Sie Antwortzeit, Token-Zählungen und Ausgabe nebeneinander. Multiplizieren Sie Token mit den oben genannten Preiszeilen, um die Kosten pro Lauf für Ihre Aufgabe zu erhalten.

Führen Sie es auf dem Aufwandniveau aus, mit dem Sie es ausliefern würden, nicht dem auf dem Benchmark-Diagramm. Laden Sie Apidog herunter, um es zu erstellen.

FAQ

Ist Grok 4.7 besser als GPT-6? Nicht nach den verfügbaren Zahlen. Der Artificial Analysis Index platziert GPT-6 Sol bei 48 und Grok 4.7 bei 46, und OpenAI nennt GPT-6 Astra sein bestes Modell. Grok 4.7 ist bei der Ausgabe günstiger und führt bei seinen eigenen juristischen und technischen Bewertungen.

Ist Grok 4.7 besser als Claude Opus 5.5? Opus 5.5 führt bei Terminal-Bench 4.0 (66,4 % vs. 37,6 %) und CursorBench 4.0 (57,8 % vs. 46,3 %) und belegt den ersten Platz im Artificial Analysis Index. Grok 4.7 kostet die Hälfte bei der Eingabe und weniger als ein Drittel bei der Ausgabe.

Welches ist am günstigsten? Pro Token ist Grok 4.7 bei der Ausgabe am günstigsten, gleichauf mit Sol bei der Eingabe. Bei starkem Prompt-Caching kann Sol die Nase vorn haben, da seine gecachten Lesevorgänge 0,20 $ pro Million kosten, gegenüber 0,50 $ bei Grok.

Kann ich alle drei kostenlos ausprobieren? Jedes hat begrenzte kostenlose Wege. Siehe wie man Grok 4.7 kostenlos nutzt, GPT-6 Sol kostenlos und Claude Opus 5.5 kostenlos.

Wie rufe ich Grok 4.7 aus dem Code auf? POST https://api.x.ai/v1/responses mit "model": "grok-4.7". Der Grok 4.7 API-Leitfaden enthält curl- und SDK-Beispiele.

Entscheiden Sie mit Ihren eigenen Zahlen

Wählen Sie die beiden Modelle aus, die zu Ihrer Arbeitslast passen, speichern Sie denselben Prompt in Apidog für beide und führen Sie ihn auf Ihrem Produktionsaufwandniveau aus. Vergleichen Sie die Kosten pro abgeschlossener Aufgabe und die Latenz, und routen Sie dann. Wenn das nächste Modell erscheint, fügen Sie eine Umgebung hinzu und führen Sie es erneut aus.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen