Anleitung Grok 4.7 API

Rufen Sie Grok 4.7 über api.x.ai/v1/responses auf: Modell-ID grok-4.7, Preismodell 2 $/6 $, Inferenzaufwand, verschlüsselte Inferenz, Caching, Tools und Ratenbegrenzungen.

Medy Evrard

29 September 2026

Anleitung Grok 4.7 API

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Um Grok 4.7 aufzurufen, senden Sie eine POST-Anfrage an https://api.x.ai/v1/responses mit "model": "grok-4.7" und Ihrem xAI-Schlüssel als Bearer-Token. Es kostet 2 $ pro Million Input-Token, 0,50 $ pro Million zwischengespeicherter Input-Token und 6 $ pro Million Output-Token für Prompts unter 200.000 Token, mit einem Kontextfenster von 500.000 Token. SpaceXAI (das Unternehmen, das früher xAI hieß) hat es am 21. September 2026 zum gleichen Preis wie Grok 4.6 veröffentlicht, sodass für die meisten bestehenden Integrationen das Upgrade eine einzeilige Änderung ist.

button

Unten: die erste Anfrage, Argumentationsaufwand und dessen Auswirkung auf Ihre Rechnung, verschlüsselte Argumentation, Caching, Streaming, Tools, Ratenbegrenzungen und ein wiederverwendbares Test-Setup in Apidog. Hintergrundinformationen zum Modell finden Sie unter was Grok 4.7 ist und was sich geändert hat; die offizielle Referenz ist die Grok 4.7-Seite in den xAI-Dokumenten.

Grok 4.7 API auf einen Blick

Eigenschaft Wert
Modell-ID grok-4.7
Endpunkt POST https://api.x.ai/v1/responses (Chat Completions funktioniert weiterhin als veralteter Endpunkt)
Kontextfenster 500.000 Token
Ausgabebeschränkung Keine von xAI aufgeführt
Input / Cache / Output, unter 200k 2,00 $ / 0,50 $ / 6,00 $ pro 1 Mio. Token
Input / Cache / Output, 200k und höher 4,00 $ / 1,00 $ / 12,00 $ pro 1 Mio. Token
Argumentationsaufwand low, medium, high (Standard), xhigh
Eingaben Text und Bilder (JPG oder PNG, bis zu 20 MiB)
Tools Funktionsaufruf, Websuche, X-Suche, Code-Ausführung
Wissensstand (Stichtag) Mai 2026
Batch-API Nicht unterstützt

Schritt 1: Schlüssel anfordern und Guthaben aufladen

Erstellen Sie ein Konto unter console.x.ai, laden Sie es mit Guthaben auf (die API ist vorausbezahlt) und generieren Sie einen Schlüssel. Unser Leitfaden für den Grok API-Schlüssel führt Sie durch die Konsolenbildschirme. Halten Sie den Schlüssel aus Ihrem Code fern:

export XAI_API_KEY="your-key-here"

Schritt 2: Ihre erste Anfrage stellen

Die Responses API ist der primäre Endpunkt und derjenige, der in jedem Beispiel der xAI-Dokumentation verwendet wird:

curl https://api.x.ai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": "Review this function for bugs: function median(a){a.sort();return a[a.length/2]}"
  }'

Die API funktioniert mit dem OpenAI SDK. Richten Sie den Client auf die Basis-URL von xAI aus und rufen Sie responses.create auf:

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.XAI_API_KEY,
  baseURL: "https://api.x.ai/v1",
});

const response = await client.responses.create({
  model: "grok-4.7",
  reasoning: { effort: "medium" },
  input: [
    { role: "system", content: "You are a senior backend reviewer." },
    { role: "user", content: "Find the bug in: function median(a){a.sort();return a[a.length/2]}" },
  ],
});

console.log(response.output_text);

Wenn Sie einen anderen Client bevorzugen, ist dasselbe Modell grok-4.7 im Python SDK von xAI (xai_sdk), xai.responses('grok-4.7') im Vercel AI SDK und xai/grok-4.7 in LiteLLM. Zwei Kompatibilitätshinweise: xAI bezeichnet Chat Completions nun als veralteten Endpunkt, und die Kompatibilität mit dem Anthropic SDK ist vollständig veraltet. Neuer Code sollte auf /v1/responses abzielen.

Schritt 3: Einen Argumentationsaufwand wählen

Grok 4.7 argumentiert immer. Sie können dies nicht ausschalten, aber Sie steuern, wie intensiv es nachdenkt, mit reasoning.effort in der Responses API (reasoning_effort im xAI SDK): low für latenzempfindliche Tool-Aufrufe, medium für Analyse und langen Kontext, high (der Standard) für schwierige mehrstufige Probleme und xhigh, wenn Qualität die Antwortzeit übertrifft.

Diese Einstellung ist der größte Hebel für Ihre Rechnung. Die Release-Seite von SpaceXAI veröffentlicht CursorBench 4.0-Ergebnisse pro Aufwandsstufe, und die Spanne ist breit:

Aufwand CursorBench 4.0 Durchschn. Kosten pro Aufgabe Durchschn. Output-Token pro Aufgabe
niedrig 33.1% 1,58 $ 15.677
mittel 41.6% 3,49 $ 36.683
hoch 43.9% 4,69 $ 56.382
sehr hoch 46.3% 6,01 $ 70.141

Der Wechsel von niedrig zu sehr hoch bringt 13,2 Punkte und kostet etwa 3,8-mal so viel pro Aufgabe, da das Modell etwa 4,5-mal so viele Output-Token schreibt. Beginnen Sie mit mittel und erhöhen Sie den Aufwand nur, wenn Ihre eigenen Tests zeigen, dass die zusätzliche Qualität von Bedeutung ist.

Eine weitere Einschränkung: Argumentationsmodelle lehnen presencePenalty, frequencyPenalty und stop ab. Wenn ein älterer Wrapper immer noch eines davon sendet, gibt die Anfrage einen Fehler zurück.

Schritt 4: Verschlüsselte Argumentation in mehrstufigen Aufrufen handhaben

Dies ist die Verhaltensänderung, die Sie am ehesten überraschen wird. Auf der Responses API gibt grok-4.7 immer reasoning.encrypted_content zurück, selbst wenn Ihre include-Liste dies nicht anfordert. Sie können die Argumentation nicht lesen, aber Sie können sie weiterführen.

Für mehrstufige Konversationen geben Sie die Argumentationspunkte aus der vorherigen Antwort unverändert im input der nächsten Anfrage zurück. Dadurch bleibt die Argumentation des Modells über die einzelnen Schritte hinweg intakt. Bearbeiten, kürzen oder neu anordnen Sie diese Elemente nicht. Wenn Ihr Code das output-Array auf message-Elemente filtert, bevor der nächste Schritt aufgebaut wird, verwirft er nun den Kontext, den Grok 4.7 zurückerwartet. Das Verhalten von Chat Completions bleibt unverändert.

Schritt 5: Caching zu Ihrem Vorteil nutzen

Zwischengespeicherte Eingaben kosten 0,50 $ pro Million Token gegenüber 2 $ für frische Eingaben, ein Rabatt von 75 %. Der Haken: Ein Cache-Treffer erfordert, dass Ihre Anfrage auf einem Server landet, der das Präfix bereits enthält. SpaceXAI „empfiehlt dringend“, prompt_cache_key bei Responses API-Aufrufen (oder den x-grok-conv-id-Header bei Chat Completions) zu setzen. Dadurch werden die Anfragen einer Konversation an denselben Server geleitet; ohne dies, warnt xAI, zahlen Sie oft den vollen Input-Preis auf einem Server ohne Cache-Daten.

Ordnen Sie den Prompt zur Wiederverwendung: System-Prompt, Tool-Schemata und Referenzdokumente zuerst, die neue Benutzernachricht zuletzt. Alles, was sich oben ändert, bricht das Präfix und damit den Rabatt.

Schritt 6: Antworten streamen

Fügen Sie "stream": true hinzu, um Server-Sent Events zu empfangen, anstatt einen einzelnen JSON-Body am Ende. Da die Argumentation immer aktiv ist, kann das Modell eine Weile nachdenken, bevor das erste Antwort-Token erscheint, und ein nicht-streaming-Aufruf wirkt dann blockiert oder löst einen kurzen HTTP-Timeout aus. Grok 4.7 streamt Argumentationszusammenfassungen, sodass Sie den Fortschritt anzeigen können, während es nachdenkt.

Funktionsaufrufe sind die Ausnahme: Laut den xAI-Dokumenten kommt ein Funktionsaufruf vollständig in einem einzigen Block an. Parsen Sie ihn, sobald dieser Block ankommt, anstatt Argumente aus Deltas zusammenzusetzen. Unser Leitfaden zum Testen von LLM-APIs, die über SSE streamen, zeigt, wie die rohe Ereignissequenz in Apidog inspiziert wird.

Schritt 7: Tools hinzufügen

Funktionsaufrufe verwenden das Tool-Format der Responses API. Sie beschreiben die Funktion, Grok gibt ein function_call-Element zurück, Sie führen es aus und senden ein function_call_output mit der passenden call_id zurück:

curl https://api.x.ai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": [{"role": "user", "content": "Has order 10482 shipped yet?"}],
    "tools": [{
      "type": "function",
      "name": "get_order_status",
      "description": "Look up the fulfillment status of an order",
      "parameters": {
        "type": "object",
        "properties": { "order_id": {"type": "string"} },
        "required": ["order_id"]
      }
    }]
  }'

Strukturierte Ausgaben werden ebenfalls unterstützt, sodass Sie die endgültige Antwort an ein JSON-Schema binden können.

Serverseitige Tools laufen auf xAI-Seite: {"type": "web_search"}, X-Suche und Code-Ausführung. Sie werden zusätzlich zu den Token abgerechnet: Websuche kostet 5 $ pro 1.000 Aufrufe, X-Suche 5 $ pro 1.000 Beiträge und Code-Ausführung 5 $ pro 1.000 Aufrufe, sodass ein Agent, der bei jeder Runde sucht, diese Gebühr bei jeder Runde zahlt. Die Websuche akzeptiert allowed_domains und excluded_domains (jeweils bis zu fünf). Ohne ein Suchtool verfügt Grok 4.7 über keine Live-Daten; sein Wissen endet im Mai 2026.

Achten Sie auf die 200k-Preisklippe

Die Preistabelle hat aus gutem Grund zwei Zeilen. Sobald ein Prompt 200.000 Token erreicht, wird die gesamte Anfrage zum höheren Satz abgerechnet: 4 $ Input, 1 $ Cache, 12 $ Output. Nicht nur die Token oberhalb der Grenze kosten mehr.

Ein 190.000-Token-Prompt mit einer 4.000-Token-Antwort kostet etwa 0,40 $. Ein 210.000-Token-Prompt mit derselben Antwort kostet etwa 0,89 $. Rund 10 % mehr Input verdoppelt die Rechnung mehr als.

Zählen Sie die Token, bevor Sie senden, fassen Sie den Verlauf zusammen, wenn eine Konversation die Grenze erreicht, und nutzen Sie xAIs Kontextkomprimierung für lange Agentenschleifen. Der günstige Teil des 500.000-Token-Fensters endet bei 200.000.

Ratenbegrenzungen und 429er-Fehler

Die Limits skalieren mit Ihren kumulierten Ausgaben und entsprechen denen von Grok 4.6:

Stufe (kumulierte Ausgaben) Anfragen pro Sekunde Token pro Minute
T0 (0 $) 150 50 Mio.
T1 (50 $) 172 53 Mio.
T2 (250 $) 208 60 Mio.
T3 (1.000 $) 312 74 Mio.
T4 (5.000 $) 500 100 Mio.

Zwischengespeicherte Token zählen zu den Token pro Minute. Wenn Sie das Limit überschreiten, erhalten Sie HTTP 429. Wiederholen Sie den Versuch mit exponentiellem Backoff und Jitter, anstatt den Endpunkt zu überlasten; unser Leitfaden zu Fehlern bei überschrittenen Ratenbegrenzungen behandelt die Muster.

Migration von Grok 4.6

Die meisten Integrationen erfordern eine Änderung: grok-4.6 wird zu grok-4.7. Preis, Kontextfenster, Ratenbegrenzungen und Aufwandsstufen sind identisch. Testen Sie drei Dinge erneut, bevor Sie den Produktions-Traffic umstellen:

Unser Grok 4.6 API-Leitfaden gilt weiterhin für alles, was sich nicht geändert hat. Zwei Hinweise: https://us.api.x.ai/v1 hält die Inferenz in den USA gegen einen Aufpreis von 10 %, und Grok 4.7 Fast (2x Preis) ist nur in Cursor und Grok Build verfügbar, nicht in der öffentlichen API.

Testen Sie die Grok 4.7 API in Apidog

Eine gespeicherte, wiederholbare Anfrage ist einem Curl-Befehl in Ihrer Shell-Historie überlegen, wenn Sie Aufwandsstufen vergleichen oder ein Upgrade überprüfen.

  1. Erstellen Sie eine Umgebung in Apidog mit base_url auf https://api.x.ai/v1 und XAI_API_KEY als geheime Variable gespeichert. Fügen Sie bei Bedarf eine zweite Umgebung für den US-Endpunkt hinzu.
  2. Speichern Sie die Anfrage: POST {{base_url}}/responses mit einem Authorization: Bearer {{XAI_API_KEY}} Header und Ihrem tatsächlichen Prompt im Body.
  3. Fügen Sie Assertions hinzu: Status ist 200, model entspricht grok-4.7, usage existiert und output enthält ein message-Element. Diese fangen einen falschen Schlüssel, eine falsche Modell-ID oder eine geänderte Antwortform ab, bevor Ihre App dies tut.
  4. Klonen Sie es pro Aufwandsstufe (niedrig, mittel, hoch, sehr hoch) und führen Sie die vier als ein Testszenario aus. Sie erhalten die Antwortzeit und Token-Nutzung für Ihren Prompt nebeneinander, nicht die eines Benchmarks.
  5. Mocken Sie den Endpunkt, sobald die Antwortform stabil ist, damit die Frontend-Arbeit ohne Kreditverbrauch fortgesetzt werden kann.

Wenn das nächste Modell veröffentlicht wird, ändern Sie eine Variable und führen Sie es erneut aus. Laden Sie Apidog herunter, um es einzurichten.

FAQ

Was ist die Modell-ID von Grok 4.7? grok-4.7. Auf Partnerplattformen ist es spacexai/grok-4.7 (Vercel AI Gateway) und x-ai/grok-4.7 (OpenRouter).

Wie viel kostet die Grok 4.7 API? 2 $ pro Million Input-Token, 0,50 $ für zwischengespeicherte Token und 6 $ Output für Prompts unter 200.000 Token, und das Doppelte bei 200.000 und mehr. Es gibt keinen Batch-Rabatt für 4.7.

Kann ich die Argumentation ausschalten? Nein. Verwenden Sie den Aufwand niedrig für die schnellsten und günstigsten Antworten.

Gibt es eine kostenlose Grok 4.7 API? xAIs API läuft mit Prepaid-Guthaben. Unser Leitfaden zur kostenlosen Nutzung von Grok 4.7 behandelt die existierenden kostenlosen Wege.

Wie vergleicht sich Grok 4.7 mit GPT-6 Sol und Claude Opus 5.5? Es hat den niedrigsten Output-Preis der drei und liegt bei den von beiden Anbietern gemeldeten Coding-Benchmarks hinter Opus 5.5. Der Dreiervergleich enthält die Zahlen.

Beginnen Sie mit einer gespeicherten Anfrage

Senden Sie die obige Curl-Anfrage und speichern Sie sie dann in Apidog mit Assertions und einem Szenario für die Aufwandsstufe. Sie erhalten eine Basiskosten pro Aufgabe für Ihre eigenen Prompts, bevor Sie den Traffic umleiten. Um eine Standard-Aufwandsstufe auszuwählen, lesen Sie als Nächstes die Aufschlüsselung der Grok 4.7 Benchmarks.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen