Claude Sonnet 5.5 kostet 2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens über die Claude API, genau wie Sonnet 5. Cache-Lesevorgänge kosten 0,20 $ pro Million, die Batch API halbiert beide Raten auf 1 $ und 5 $, das volle 1M Kontextfenster wird zum Standardtarif abgerechnet, und der schnelle Modus wird nicht angeboten. Die geplante Preiserhöhung von Sonnet 5 auf 3 $/15 $ zum 1. September wurde abgesagt, sodass 2 $/10 $ nun der Standardpreis ist.
Dieser Leitfaden listet jeden Posten der Claude Sonnet 5.5 Preisgestaltung auf, arbeitet drei Kostenbeispiele mit der gezeigten Arithmetik durch und erklärt, warum der Aufwand Ihre Rechnung stärker beeinflusst als der Pro-Token-Preis. Neu beim Modell? Beginnen Sie mit was Claude Sonnet 5.5 ist, oder lesen Sie wie Sie Claude Sonnet 5.5 kostenlos nutzen können. Um die Zahlen mit Ihrem eigenen Traffic zu vergleichen, senden Sie die Anfrage von Apidog und lesen Sie den usage-Block in jeder Antwort.
Claude Sonnet 5.5 API-Preistabelle
Preise pro Million Tokens (MTok), aus den Preisdokumenten von Anthropic:
| Posten | Preis pro MTok |
|---|---|
| Eingabe (Input) | 2,00 $ |
| 5-Minuten-Cache-Schreibvorgang | 2,50 $ |
| 1-Stunden-Cache-Schreibvorgang | 4,00 $ |
| Cache-Lesevorgang | 0,20 $ |
| Ausgabe (Output) | 10,00 $ |
| Batch-Eingabe | 1,00 $ |
| Batch-Ausgabe | 5,00 $ |
Drei Details beeinflussen, was Sie bezahlen:
- Inferenz nur in den USA.
inference_geo: "us"kostet das 1,1-fache für jede Token-Kategorie auf der Claude API und der Claude Platform auf AWS (2,20 $ Eingabe, 11 $ Ausgabe, 0,22 $ Cache-Lesevorgänge). Foundrys Bereitstellung in der US-Datenzone hat den gleichen 1,1-fachen Satz; Bedrock und Google Cloud bepreisen separat. - Kein Aufpreis für langen Kontext. Eine 900k-Token-Anfrage kostet pro Token dasselbe wie eine 9k-Token-Anfrage.
- Gleicher Tokenizer wie Sonnet 5. Ihre Token-Zahlen werden unverändert übernommen.
Wie Sonnet 5.5 im Listenpreisvergleich abschneidet
| Modell | Eingabe | Ausgabe | Anmerkungen |
|---|---|---|---|
| Claude Sonnet 5.5 | 2 $ | 10 $ | Cache-Lesevorgang 0,20 $; 1M Kontext; kein schneller Modus |
| Claude Sonnet 5 | 2 $ | 10 $ | Cache-Lesevorgang 0,20 $; 3 $/15 $ Preisanstieg abgesagt |
| Claude Opus 5.5 | 4 $ | 20 $ | Cache-Lesevorgang 0,20 $; schneller Modus 8 $/40 $ |
| Claude Haiku 4.5 | 1 $ | 5 $ | 200k Kontext |
| GPT-6 Sol | 2 $ | 10 $ | 90% Rabatt auf zwischengespeicherte Eingabe; 872k Kontext |
| GPT-6 Luna | 0,10 $ | 0,50 $ | 1M Kontext |
Sonnet 5.5 kostet die Hälfte von Opus 5.5 bei Eingabe, Ausgabe und Cache-Schreibvorgängen. Es teilt sich den exakten Listenpreis von 2 $/10 $ mit GPT-6 Sol, sodass die Wahl zwischen diesen beiden Modellen von den Ergebnissen pro Aufgabe abhängt. Für die Hintergrundgeschichte siehe Claude Sonnet 5 Preise, den Preiskrieg vom September 2026 und GPT-6 Sol Preise.
Durchgerechnete Beispiele: Was echte Anfragen kosten
Die Formel für jede Zeile: Tokens ÷ 1.000.000 × Preis pro MTok. Jeden Posten einzeln berechnen, dann addieren.
Beispiel 1: Eine Chat-ähnliche Anfrage
3.000 Input-Tokens, 800 Output-Tokens, kein Caching.
- Eingabe: 3.000 ÷ 1.000.000 × 2 $ = 0,006 $
- Ausgabe: 800 ÷ 1.000.000 × 10 $ = 0,008 $
- Gesamt: 0,006 $ + 0,008 $ = 0,014 $
Tausend davon kosten 14 $. Die Ausgabe macht 21 % der Tokens aus, aber 57 % der Rechnung, daher ist die Ausgabelänge wichtiger als die Prompt-Länge.
Beispiel 2: Ein Agent liest ein 50.000-Token-Präfix erneut
Eine Agentenschleife sendet dasselbe 50.000-Token-Präfix (System-Prompt, Tools, Repo-Kontext) bei 20 Aufrufen. Hier wird nur das Präfix berechnet.
Nicht gecacht: 20 × 50.000 = 1.000.000 Tokens; 1.000.000 ÷ 1.000.000 × 2 $ = 2,00 $
Gecacht, mit einem 5-Minuten-Schreibvorgang:
- Aufruf 1 schreibt den Cache: 50.000 ÷ 1.000.000 × 2,50 $ = 0,125 $
- Aufrufe 2 bis 20 lesen ihn: 19 × 50.000 = 950.000 Tokens; 950.000 ÷ 1.000.000 × 0,20 $ = 0,19 $
- Gesamt: 0,125 $ + 0,19 $ = 0,315 $
Das spart 1,685 $, etwa 84 %. Der 5-Minuten-Schreibvorgang zahlt sich nur aus, solange Aufrufe innerhalb des Fensters erfolgen; bei langsameren Schleifen kostet ein 1-Stunden-Schreibvorgang 50.000 ÷ 1.000.000 × 4 $ = 0,20 $, sodass der Gesamtbetrag 0,20 $ + 0,19 $ = 0,39 $ beträgt, immer noch etwa 80 % unter dem nicht gecachten Betrag. Dieselbe Argumentation wird für Opus in unserer Kostenberechnung für Prompt-Caching angewendet; der Lesesatz von 0,20 $ ist identisch.
Beispiel 3: Ein Batch-Job mit 10.000 Anfragen
Gleiche Form wie Beispiel 1, über die Batch API gesendet.
- Eingabe: 10.000 × 3.000 = 30.000.000 Tokens; 30 × 1 $ = 30 $
- Ausgabe: 10.000 × 800 = 8.000.000 Tokens; 8 × 5 $ = 40 $
- Batch-Gesamt: 70 $, gegenüber 30 × 2 $ + 8 × 10 $ = 140 $ zu Standardtarifen
Batch erhöht auch die Ausgabegrenze von 128K auf 300K Tokens mit der output-300k-2026-03-24 Beta.
Kosten pro Aufgabe, nicht pro Token
Die Preisliste sagt Ihnen, was ein Token kostet, nicht wie viele Tokens Ihre Aufgabe verbraucht. Diese zweite Zahl schwankt mit dem Aufwand weitaus stärker als jeder Preisunterschied zwischen Modellen.
Anthropic sagt, dass Sonnet 5.5 in seinen Tests „bis zu 30 % weniger pro Aufgabe kostet als sein Vorgänger.“ Der Launch-Post zeigt auch die Kosten auf jeder Anstrengungsstufe. Die Terminal-Bench 4.0 Läufe stammen von Anthropic selbst, FrontierCode wurde von Cognition durchgeführt, und die Indexkosten stammen von Artificial Analysis:
| Aufwand | Terminal-Bench 4.0 (Punktzahl, $/Versuch) | FrontierCode v1.1 (Punktzahl, $/Aufgabe) | AA Index (Punktzahl, Kosten für Ausführung) |
|---|---|---|---|
| niedrig | 20.0%, 0,76 $ | 29.3%, 0,19 $ | 35.8, 544 $ |
| mittel | 28.8%, 0,83 $ | 36.5%, 0,24 $ | 40.7, 701 $ |
| hoch | 43.0%, 1,94 $ | 49.4%, 0,42 $ | 46.7, 1.176 $ |
| sehr hoch | 61.5%, 5,30 $ | 52.1%, 1,59 $ | 51.9, 2.738 $ |
| maximal | 70.6%, 12,54 $ | 46.2%, 20,78 $ | 56.0, 8.977 $ |
Was auffällt:
- Maximaler Aufwand kostet auf Terminal-Bench etwa das 6,5-fache des hohen Aufwands (12,54 $ ÷ 1,94 $ = 6,46). Der Index von Artificial Analysis kostete im maximalen Aufwand etwa das 16,5-fache der Ausführung bei niedrigem Aufwand (8.977 $ ÷ 544 $).
- Mehr Aufwand ist nicht immer besser. FrontierCode fällt von 52,1 % bei sehr hohem Aufwand auf 46,2 % bei maximalem Aufwand, während die Kosten pro Aufgabe um das 13-fache steigen (20,78 $ ÷ 1,59 $). Anthropic's Fußnote besagt, dass das Modell bei maximalem Aufwand häufiger eine Überprüfungsfunktion ausführte, die Unteragenten verzweigt, was in von Cognition untersuchten Fällen zu einem Timeout oder außerhalb des Gültigkeitsbereichs liegenden Änderungen führte.
- Opus bei geringerem Aufwand konkurriert. Opus 5.5 erreichte bei mittlerem Aufwand 57,6 % auf Terminal-Bench für 2,94 $, gegenüber Sonnet 5.5’s 43,0 % bei hohem Aufwand für 1,94 $. Unser Sonnet 5.5 vs. Opus 5.5 Vergleich geht auf diesen Kompromiss ein.
Umfangreiche Ausgaben bei maximalem Aufwand ist die andere Falle. OfficeChais Auswertung der Artificial Analysis Daten zeigt Sonnet 5.5 bei etwa 193.000 Output-Tokens pro Index-Aufgabe bei maximalem Aufwand, wobei die Kosten pro Aufgabe etwa 50 % über Sonnet 5 liegen. Simon Willison berichtete auf Hacker News, dass ein Lauf mit maximalem Aufwand 128.000 Denk-Tokens verbrauchte und abbrach, bevor die Antwort erzeugt wurde.
Sechs Hebel, die die Rechnung senken
- Aufwand gezielt einstellen. Die API verwendet standardmäßig
hoch; Claude Code und die Claude Apps verwenden standardmäßigmittel. Anthropic’s Prompting-Anleitung empfiehltmitteloderniedrigfür Chats undsehr hochodermaximalnur für messbare Qualitätsverbesserungen. Übernehmen Sie keine Sonnet 5-Einstellungen; die Skala wurde neu kalibriert. - Verwenden Sie
between_tools, wo Sie Thinking ausgeschaltet hatten.thinking: {"type": "disabled"}gibt jetzt einen 400er-Fehler zurück;{"type": "between_tools"}ersetzt dies beiniedrig,mittelundhoch. - Alles Wiederverwendete cachen. Der minimale cachebare Prompt beträgt 512 Tokens (1.024 bei Sonnet 5). Das Ändern des Top-Level-
effortzwischen Anfragen macht den Cache ungültig, halten Sie ihn also konstant. - Was warten kann, im Batch verarbeiten. Halber Preis für Eingabe und Ausgabe.
max_tokensehrlich halten. Anthropic’s Anleitung behandeltstop_reason: "max_tokens"als fehlgeschlagene Antwort, sodass eine abgeschnittene Antwort Kosten verursacht, ohne etwas Nutzbares zu liefern.- Unerwünschte Arbeit kürzen. Sonnet 5.5 fügt Tests, Dokumente und Dateien hinzu, die Sie nicht angefordert haben, und startet zusätzliche Überprüfungsrunden bei
sehr hochundmaximal. Anthropic's vorgeschlagener System-Prompt-Absatz reduzierte die Sitzungskosten beimaximalum etwa ein Drittel ohne Qualitätsverlust.- Claude-Pläne (claude.com/pricing): Kostenlos ist 0 $ und beinhaltet Sonnet im Chat, ohne Claude Code. Pro kostet 17 $/Monat bei jährlicher Abrechnung oder 20 $ monatlich. Max beginnt bei 100 $/Monat. Team-Seats kosten 20 $/25 $ (Standard) oder 100 $/125 $ (Premium), jährlich/monatlich. Keiner davon beinhaltet API-Zugang.
- GitHub Copilot: Pro (10 $/Monat), Pro+, Max, Business und Enterprise, abgerechnet zu den Listenpreisen des Anbieters. Copilot Pro beinhaltet 1.500 AI-Guthaben pro Monat zu je 0,01 $, etwa 15 $ an Tokens, oder ungefähr 1.070 Anfragen von Beispiel 1 (15 $ ÷ 0,014 $). Copilot Free und Student können es nicht auswählen.
- Cursor: gleiche Raten aus dem Pool „Andere Modelle“ (Pro, Pro Plus und Ultra), plus 10 % für US-only Endpunkte (2,20 $/11 $).
- OpenRouter: 2 $/10 $, oder 1 $/5 $ für die
:batch-Variante. Keine:free-Variante. - Vercel AI Gateway: 2 $/10 $ mit 0,20 $ Cache-Lesevorgängen. Das kostenlose Guthaben von 5 $ deckt Sonnet 5.5 nicht ab.
- Bedrock, Google Cloud, Foundry: jeweils die eigene Preisliste der Cloud. Bedrock unterstützt nur den Standard-Tier, ohne Batch.
- Suchen Sie stattdessen nach Guthaben? Siehe Gibt es eine kostenlose Claude Sonnet 5.5 API.
- Jede Messages-Antwort enthält ein
usage-Objekt mitinput_tokens,output_tokensund Cache-Zählungen. Das reicht aus, um jeden Aufruf in Apidog zu bepreisen:- Speichern Sie Ihren Schlüssel als Umgebungsvariable
ANTHROPIC_API_KEY. - Speichern Sie diese Anfrage einmal pro Aufwandstufe (
niedrig,mittel,hoch) mit demselben Prompt: - Fügen Sie einen Post-Prozessor hinzu, der den Aufruf bepreist und bei Trunkierung fehlschlägt:
- Führen Sie alle drei aus und vergleichen Sie
usage.output_tokensund die Kosten nebeneinander. Wenn Sie cachen, addieren Sie die Cache-Zählungen zu ihren jeweiligen Raten.
- Speichern Sie Ihren Schlüssel als Umgebungsvariable
- Die vollständige Anleitung zur Anfrage finden Sie unter wie man die Claude Sonnet 5.5 API verwendet.
- Wie viel kostet Claude Sonnet 5.5 pro Million Tokens? 2 $ Eingabe und 10 $ Ausgabe über die Claude API. Cache-Lesevorgänge kosten 0,20 $; die Batch API berechnet 1 $ und 5 $.
- Ist Sonnet 5.5 teurer als Sonnet 5? Nein. Der Preis pro Token ist identisch, und Anthropic sagt, dass Sonnet 5.5 in seinen Tests bis zu 30 % weniger pro Aufgabe kostet.
- Gibt es einen Aufpreis über 200k Tokens? Nein. Das volle 1M Kontextfenster wird zum Standardtarif abgerechnet.
- Hat Sonnet 5.5 einen schnellen Modus? Nein. Der schnelle Modus ist nur für Opus 5.5, Opus 5 und Opus 4.8 verfügbar.
- Ist Claude Sonnet 5.5 kostenlos? In der Claude Chat-App ja: Jeder kann im kostenlosen Plan damit chatten. Die API läuft auf Prepaid-Guthaben; der Leitfaden zur kostenlosen API behandelt die Guthabenprogramme.
- Nehmen Sie Ihre drei häufigsten Anfragetypen, führen Sie jeden auf zwei Aufwandstufen aus und multiplizieren Sie die
usage-Zahlen mit der obigen Tabelle. Sie werden schnell sehen, obmittelIhren Qualitätsstandard erfüllt oderhochseine zusätzlichen Tokens wert ist. Laden Sie Apidog herunter, um diese Anfragen und das Kostenskript nebeneinander zu halten.
Nächster Schritt: Bepreisen Sie Ihre eigene Arbeitslast
FAQ
const body = pm.response.json();
const u = body.usage;
const cost = (u.input_tokens * 2 + u.output_tokens * 10) / 1e6;
pm.environment.set("last_call_usd", cost.toFixed(5));
pm.test("not truncated", () => pm.expect(body.stop_reason).to.not.eql("max_tokens"));
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 4000,
"thinking": {"type": "between_tools"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'

