Claude Opus 5 wurde am 24. Juli 2026 zum Preis von 5 $ pro Million Eingabe-Tokens und 25 $ pro Million Ausgabe-Tokens eingeführt. Das ist derselbe Preis, den Anthropic für Opus 4.8 berechnete, und genau die Hälfte dessen, was Fable 5 kostet. Die Startberichterstattung lief überall mit dieser Schlagzeile, und sie ist insofern korrekt, als sie reicht.
Was die Berichterstattung ausgelassen hat, ist der Teil, der Ihre Rechnung bestimmt: Cache-Schreibvorgänge, Cache-Treffer, Batch-Preise, schneller Modus, der regionale Multiplikator und die Verhaltensänderungen, die die Token-Anzahl unauffällig verschieben. Dieser Leitfaden bietet Ihnen die vollständige Preistabelle und berechnet dann die Kosten für reale Anfragen, damit Sie ein Budget festlegen können, bevor Sie starten. Um die Zahlen mit Ihrem eigenen Traffic abzugleichen, senden Sie die Anfragen von Apidog und lesen Sie den usage-Block bei jeder Antwort.
Die vollständige Preisübersicht für Claude Opus 5
Jeder untenstehende Preis stammt aus der Preisdokumentation von Anthropic und gilt für die Modell-ID claude-opus-5.
| Token-Kategorie | Preis pro Million Tokens |
|---|---|
| Eingabe (Standard) | 5,00 $ |
| Ausgabe (Standard) | 25,00 $ |
| Prompt-Cache-Schreibvorgang, 5 Minuten TTL | 6,25 $ |
| Prompt-Cache-Schreibvorgang, 1 Stunde TTL | 10,00 $ |
| Cache-Treffer und Aktualisierungen | 0,50 $ |
| Batch API-Eingabe | 2,50 $ |
| Batch API-Ausgabe | 12,50 $ |
| Schneller Modus Eingabe | 10,00 $ |
| Schneller Modus Ausgabe | 50,00 $ |
Einige wichtige Punkte:
- Cache-Treffer kosten ein Zehntel der Standardeingabe. Dies ist der größte Hebel in der Tabelle.
- Der 5-Minuten-Cache-Schreibvorgang hat einen 1,25-fachen Aufschlag gegenüber der Standardeingabe; der 1-Stunden-Schreibvorgang einen 2-fachen.
- Batch bietet pauschal 50 % Rabatt auf Eingabe und Ausgabe.
- Der schnelle Modus ist genau doppelt so teuer wie der Standardpreis für die 2,5-fache Ausgabegeschwindigkeit. Es handelt sich um eine Forschungsvorschau, nur über die First-Party-API (nicht Bedrock, Google Cloud oder Microsoft Foundry) verfügbar, und er lässt sich nicht mit der Batch-API kombinieren.
- Es gibt keinen Aufpreis für langen Kontext. Das 1M-Token-Kontextfenster ist Standard und Maximum, und Tokens, die eine bestimmte Schwelle überschreiten, werden zum gleichen Preis von 5 $ abgerechnet. Einige konkurrierende Modelle berechnen mehr, sobald Sie eine Kontextstufe überschreiten. Opus 5 nicht.

Dieser letzte Punkt setzt eine harte Obergrenze für eine einzelne Anfrage. Der teuerste mögliche Messages API-Aufruf sind 1 Million Eingabe-Tokens plus das maximale 128k Ausgabe: 5,00 $ + 3,20 $ oder 8,20 $. Bei der Batch API, bei der die maximale Ausgabe mit dem Beta-Header output-300k-2026-03-24 auf 300k steigt, ist die Ausgabeseite auf 3,75 $ begrenzt.
Der Anker: gleich wie 4.8, die Hälfte von Fable 5
Hier sehen Sie, wie Opus 5 im Vergleich zu den Modellen abschneidet, mit denen Sie es höchstwahrscheinlich vergleichen.
| Modell | Eingabe / MTok | Ausgabe / MTok |
|---|---|---|
| Claude Opus 5 | 5,00 $ | 25,00 $ |
| Claude Opus 4.8 | 5,00 $ | 25,00 $ |
| Claude Fable 5 | 10,00 $ | 50,00 $ |
| Claude Sonnet 5 (Einführung, bis 31. August 2026) | 2,00 $ | 10,00 $ |
| Claude Sonnet 5 (ab 1. September 2026) | 3,00 $ | 15,00 $ |
Zwei Interpretationen dieser Tabelle sind wichtig.
Erstens, ein Upgrade von Opus 4.8 kostet pro Token nichts. Der Preis ist identisch und war es auch schon bei 4.5, 4.6, 4.7 und 4.8. Der Austausch der Modell-ID hat keinen Einfluss auf Ihre Stückkosten. Was sich jedoch ändert, ist Ihr Token-Volumen, worauf wir weiter unten eingehen werden. Die Opus 4.8 Preisübersicht gilt weiterhin für alles, was auf der älteren ID läuft.
Zweitens, Opus 5 ist die Hälfte von Fable 5. Anthropic's Startzahlen behaupten, dass Opus 5 innerhalb von 0,5 % des Spitzenwerts von Fable 5 auf CursorBench 3.2 liegt und es auf OSWorld 2.0 zu etwa einem Drittel der Kosten pro Aufgabe übertrifft. Dies sind vom Anbieter erstellte Zahlen aus dem Opus 5 Startbeitrag, und niemand hat sie Stand 25. Juli 2026 unabhängig reproduziert. Behandeln Sie diese als Behauptungen, nicht als gesicherte Ergebnisse. Der Vergleich von Opus 5 vs. Fable 5 beleuchtet, wo der Preisunterschied sich lohnt, und die Fable 5 Preisliste enthält die Details für höhere Stufen.
Rechenbeispiel 1: Eine einzelne Anfrage
Beginnen wir mit der einfachsten Form. Ein Zusammenfassungsaufruf mit 8.000 Eingabe-Tokens und 1.200 Ausgabe-Tokens.
- Eingabe: 8.000 / 1.000.000 x 5,00 $ = 0,040 $
- Ausgabe: 1.200 / 1.000.000 x 25,00 $ = 0,030 $
- Gesamt: 0,070 $ pro Aufruf
Bei 10.000 Aufrufen pro Monat sind das 700 $. Dieselbe Arbeitslast auf Fable 5 kostet 0,140 $ pro Aufruf oder 1.400 $ pro Monat. Auf Sonnet 5 zum Einführungspreis kostet es 0,028 $ pro Aufruf oder 280 $.
Beachten Sie, dass die Ausgabe 43 % der Rechnung bei einer Anfrage ausmacht, die fast siebenmal mehr Eingabe als Ausgabe hat. Die Ausgabe kostet fünfmal so viel wie die Eingabe, daher dominiert das Ausgabevolumen schneller als die meisten Leute erwarten. Das ist bei Opus 5 wichtiger als bei 4.8, da Denk-Tokens als Ausgabe abgerechnet werden und adaptives Denken jetzt standardmäßig aktiviert ist.
Rechenbeispiel 2: Eine lange Agenten-Sitzung mit Caching
Hier liegt das eigentliche Geld und die echten Einsparungen. Nehmen wir einen Coding-Agenten mit einem 120.000 Token System-Prompt plus Repo-Kontext, der eine 40-Runden-Sitzung durchläuft. Jede Runde fügt 1.500 Tokens neuer Konversation hinzu und erzeugt 2.500 Ausgabe-Tokens.
Ohne Prompt-Caching senden Sie den vollständigen Kontext bei jeder Runde erneut:
| Posten | Tokens | Rate | Kosten |
|---|---|---|---|
| Eingabe (120.000 x 40, plus 60.000 neu) | 4.860.000 | 5,00 $ | 24,30 $ |
| Ausgabe (2.500 x 40) | 100.000 | 25,00 $ | 2,50 $ |
| Gesamt | 26,80 $ |
Mit einem 5-Minuten-Prompt-Cache für das 120.000 Token Präfix:
| Posten | Tokens | Rate | Kosten |
|---|---|---|---|
| Cache-Schreibvorgang, einmalig | 120.000 | 6,25 $ | 0,75 $ |
| Cache-Lesevorgänge (39 Runden) | 4.680.000 | 0,50 $ | 2,34 $ |
| Neue Eingabe (1.500 x 40) | 60.000 | 5,00 $ | 0,30 $ |
| Ausgabe (2.500 x 40) | 100.000 | 25,00 $ | 2,50 $ |
| Gesamt | 5,89 $ |
Das ist eine Reduzierung um 78 %, und die Ausgabe macht jetzt 42 % der Rechnung aus statt 9 %. Sobald Sie richtig cachen, ist die Ausgabe das Nächste, was Sie optimieren.
Eine Einschränkung bei der 5-Minuten-TTL: Cache-Lesevorgänge aktualisieren sie, sodass eine Sitzung mit Runden, die weniger als fünf Minuten auseinanderliegen, bei einem einzigen Schreibvorgang "warm" bleibt. Wenn Ihr Agent länger als das inaktiv ist, verwenden Sie den 1-Stunden-Schreibvorgang für 10 $ pro Million. Hierdurch steigt der Schreibvorgang von 0,75 $ auf 1,20 $ und die Gesamtkosten auf 6,34 $, immer noch 76 % unter dem ungecachten Lauf.
Rechenbeispiel 3: Stapelverarbeitung
Für alles, was keine synchrone Antwort benötigt, bietet die Batch API pauschal 50 % Rabatt. Nehmen Sie 50.000 Dokumente mit jeweils 1.200 Eingabe-Tokens und 150 Ausgabe-Tokens.
| Pfad | Eingabekosten | Ausgabekosten | Gesamt |
|---|---|---|---|
| Standard | 60 MTok x 5,00 $ = 300,00 $ | 7,5 MTok x 25,00 $ = 187,50 $ | 487,50 $ |
| Batch | 60 MTok x 2,50 $ = 150,00 $ | 7,5 MTok x 12,50 $ = 93,75 $ | 243,75 $ |
Gleiche Tokens, gleiches Modell, 243,75 $ gespart. Der Kompromiss ist Latenz, nicht Qualität. Wenn Ihre Klassifizierungs-, Anreicherungs- oder Bewertungsaufträge asynchrone Lieferung tolerieren, lassen Sie die Hälfte des Budgets ungenutzt, wenn Sie sie über den Standard-Endpunkt ausführen.
Rechenbeispiel 4: Was der schnelle Modus tatsächlich kostet
Der schnelle Modus verdoppelt den Preis auf 10 $ / 50 $ für etwa die 2,5-fache Ausgabegeschwindigkeit. Führen Sie die Anfrage aus Beispiel 1 damit aus und Sie erhalten 0,080 $ Eingabe plus 0,060 $ Ausgabe, also 0,140 $ pro Aufruf, genau das Doppelte.
Das preislich setzt Opus 5 identisch mit dem Standardpreis von Fable 5: Sie zahlen Spitzenpreise für Latenz, nicht für Fähigkeiten. Es lohnt sich für interaktive Oberflächen, bei denen ein Benutzer Tokens erscheinen sieht, ist aber schwer für Hintergrundarbeiten zu rechtfertigen. Es lässt sich nicht mit der Batch API kombinieren, daher sind die beiden Kostenhebel konstruktionsbedingt gegenseitig ausschließend.
Die vier Hebel, die Ihre Rechnung tatsächlich beeinflussen
Diese vier Punkte sind spezifisch für Opus 5 und geben genau an, wie viel sie einsparen.
1. Das Mindestmaß des Prompt-Caches wurde auf 512 Tokens gesenkt
Bei Opus 4.8 betrug das cachebare Minimum 1.024 Tokens. Bei Opus 5 sind es 512. Prompts, die zuvor zu kurz zum Cachen waren, werden nun ohne Code-Änderung, außer dem Hinzufügen des Cache-Kontrollblocks, gecacht.
Die Gewinnschwelle ist besser, als die meisten Leute annehmen. Ein Cache-Schreibvorgang kostet das 1,25-fache der Standardeingabe, ein Lesevorgang das 0,1-fache. Der Punkt, an dem Caching gewinnt:
- 5 Minuten TTL: Am Break-Even-Punkt bei 1,3 Anfragen. Sie sind ab dem zweiten Aufruf im Vorteil.
- 1 Stunde TTL: Am Break-Even-Punkt bei 2,1 Anfragen. Sie sind ab dem dritten Aufruf im Vorteil.
Konkret kostet ein 700 Token System-Prompt, der in einem Burst über 1.000 Aufrufe wiederverwendet wird, ungecacht 3,50 $. Gecacht kostet er 0,0044 $ für den Schreibvorgang plus 999 Lesevorgänge zu 0,00035 $, also insgesamt 0,354 $. Dieser Prompt konnte auf Opus 4.8 überhaupt nicht gecacht werden.
2. Batch mit 50 % Rabatt
Oben bereits behandelt, aber als Hebel wiederholungswert: Prüfen Sie, welche Arbeitslasten tatsächlich eine synchrone Antwort benötigen. Auswertungsläufe, Nachfüllungen, nächtliche Zusammenfassungen und Inhaltsklassifizierung tun dies in der Regel nicht.
3. Die Aufwandsstufen low und medium sind endlich nutzbar
output_config.effort steuert, wie viel das Modell "denkt", und Denk-Tokens werden als Ausgabe mit 25 $ pro Million abgerechnet. Opus 5 hat die Aufwandsstufen neu kalibriert, und Anthropic gibt an, dass low und medium deutlich stärker sind als bei früheren Opus-Modellen. Der Standard ist high; xhigh bleibt der empfohlene Startpunkt für Kodierungs- und Agentenarbeiten.
Einsparungen skalieren direkt mit dem Volumen der Denk-Tokens. Wenn eine Aufgabe durchschnittlich 8.000 Denk-Tokens bei xhigh und 1.500 bei low benötigt, sparen Sie 6.500 Ausgabe-Tokens oder 0,1625 $ pro Aufgabe, was bei 100.000 Aufgaben 16.250 $ entspricht. Diese Zahlen sind illustrativ: Der tatsächliche Unterschied hängt von Ihren Prompts ab, weshalb Anthropic Ihnen empfiehlt, einen neuen Aufwands-Sweep gegen Ihre eigenen Bewertungen durchzuführen, anstatt die 4.8-Einstellungen zu übernehmen. Der Leitfaden zum Effort-Parameter behandelt diesen Sweep.
Eine Falle: Das Senken des Aufwands reduziert Denk-Tokens, nicht die sichtbare Antwortlänge. Die Standardantworten und schriftlichen Ergebnisse von Opus 5 sind länger als die von Opus 4.8, und der Aufwand wird dies nicht beheben. Wenn Sie kürzere Antworten wünschen, fragen Sie nach kürzeren Antworten.
4. Geringere Tool-Use System-Prompt-Overhead
Wenn Sie Tool-Definitionen senden, injiziert die API einen System-Prompt, den Sie bezahlen. Bei Opus 5 beträgt dieser Overhead 286 Tokens für auto oder none Tool-Auswahl, gegenüber 290 bei Opus 4.8 und 675 bei Opus 4.7.
Seien Sie ehrlich über die Größe dieses Punktes. Im Vergleich zu 4.8 beträgt der Unterschied von vier Tokens 20 $ bei einer Million Anfragen: vernachlässigbar. Im Vergleich zu 4.7 beträgt der Unterschied von 389 Tokens 0,001945 $ pro Anfrage, oder 1.945 $ pro Million Anfragen. Wenn Sie noch auf 4.7 sind, ist das echtes Geld; auf 4.8 ist es ein Rundungsfehler.
Für Hebel, die für die gesamte Claude-Produktlinie gelten, bietet unser Leitfaden zum Senken Ihrer Claude API-Rechnung eine breitere Perspektive.
Zwei Posten, die oft übersehen werden
Der Multiplikator inference_geo: "us" beträgt 1,1x. Wenn Sie die Inferenz für Compliance oder Datenresidenz an eine reine US-Infrastruktur binden, wird jede Token-Kategorie mit 1,1 multipliziert: Eingabe 5,50 $, Ausgabe 27,50 $, Cache-Treffer 0,55 $, Batch 2,75 $ / 13,75 $. Die Arbeitslast aus Beispiel 1 steigt von 700 $ pro Monat auf 770 $. Bei einer Rechnung von 50.000 $ ist das ein Posten von 5.000 $, prüfen Sie also, ob Sie die Bindung benötigen, bevor Sie sie festlegen.
Priority Tier wird auf Opus 5 nicht unterstützt. Opus 4.8 behält es. Wenn Ihre Kapazitätsplanung von Priority Tier-Zusagen abhängt, ist das eine echte Einschränkung für den Übergang. Der Migrationsleitfaden von Opus 4.8 zu Opus 5 behandelt dies zusammen mit den bahnbrechenden API-Änderungen.
Verhaltensänderungen, die auf Ihrer Rechnung erscheinen
Die Token-Preise sind die eine Hälfte der Rechnung. Das Token-Volumen ist die andere Hälfte, und drei Verhaltensänderungen von Opus 5 treiben das Volumen in die Höhe, wenn Sie nichts tun.
- Denken ist standardmäßig aktiviert. Bei Opus 4.8 wurde eine Anfrage ohne
thinking-Feld ohne Denken ausgeführt. Bei Opus 5 führt dieselbe Anfrage adaptives Denken aus, und diese Tokens werden als Ausgabe abgerechnet. Damax_tokensDenken und Antwort zusammen begrenzt, werden einige dieser Arbeitslasten auch abgeschnitten. - Opus 5 delegiert leichter an Subagenten. Jeder Subagent ist ein eigenes Set von abgerechneten Tokens. Begrenzen oder beschränken Sie die Delegation bei kostensensiblen Arbeitslasten.
- Opus 5 überprüft seine eigene Arbeit unaufgefordert. Wenn Sie Anweisungen wie „Überprüfen Sie Ihre Arbeit“ übernommen haben, rät Anthropic in seinem Prompting-Leitfaden, diese zu entfernen. Überprüfung bedeutet Tokens.
Keine davon ändert den Preis pro Token. Alle ändern, was Sie bezahlen.
Bestätigung Ihrer tatsächlichen Ausgaben mit Apidog
Der schnellste Weg, das Rätselraten zu beenden, ist, das usage-Objekt jeder Antwort zu lesen. Es meldet input_tokens, output_tokens, cache_creation_input_tokens und cache_read_input_tokens separat, was genau die Aufschlüsselung ist, die Sie benötigen, um die obige Berechnung mit Ihrem eigenen Traffic abzugleichen.

Apidog ist eine API-Entwicklungs- und Testplattform, die dies gut handhabt. Richten Sie eine Anfrage an den Messages-Endpunkt mit "model": "claude-opus-5" und dann:
- Duplizieren Sie die gespeicherte Anfrage einmal pro Aufwandsstufe und vergleichen Sie das Volumen der Denk-Tokens nebeneinander bei identischen Prompts.
- Stellen Sie sicher, dass
usage.cache_read_input_tokensgrößer als Null ist, damit ein stillschweigend defekter Cache als fehlgeschlagener Test anstatt als überraschende Rechnung erscheint. - Speichern Sie Schlüssel als Umgebungsvariablen anstatt im Anfragetext, damit ein Entwicklungsschlüssel niemals eine Batch-Verarbeitung in Produktionsgröße ausführt.
- Beobachten Sie den SSE-Stream, um zu sehen, wohin die Ausgabe-Tokens bei langen Generierungen gehen.
Laden Sie Apidog herunter, um diese Prüfungen zusammen mit der Anleitung in unserem Opus 5 API-Leitfaden durchzuführen.
Was Sie tatsächlich für 5 $ / 25 $ kaufen
Opus 5 bietet ein starkes Preis-Leistungs-Verhältnis und ist nicht die Spitze des Claude-Stacks. Fable 5 bleibt Anthropics leistungsfähigstes, weit verbreitetes Modell, und Opus 5 hinkt Mythos 5 bei der Cybersicherheitsausnutzung und autonomen Biologieforschung immer noch hinterher. Anthropic erklärt beides deutlich. Die ehrliche Formulierung ist: Spitzenklasse-Fähigkeiten zum halben Spitzenpreis, mit einer genannten Obergrenze darüber. Unser Mythos-Klasse Erklärer behandelt, was oberhalb dieser Linie liegt.
Für die meisten Teams ist die eigentliche Frage nicht Opus 5 gegenüber der Obergrenze. Es ist vielmehr, ob die Arbeitslast überhaupt Opus benötigt, oder ob Sonnet 5 für 2 $ / 10 $ (steigend auf 3 $ / 15 $ am 1. September 2026) die Arbeit für 40 % des Preises erledigt. Führen Sie beide Modelle gegen Ihre eigenen Evaluierungen aus, bevor Sie ein Budget festlegen. Volle Spezifikationen und Verfügbarkeit finden Sie in unserer Claude Opus 5 Übersicht; Anthropics Modellübersicht enthält die kanonische Tabelle.
FAQ
Wie viel kostet Claude Opus 5? 5 $ pro Million Eingabe-Tokens und 25 $ pro Million Ausgabe-Tokens über die Standard-API. Cache-Treffer kosten 0,50 $, Batch-Läufe kosten 2,50 $ / 12,50 $ und der schnelle Modus 10 $ / 50 $.
Ist Claude Opus 5 teurer als Opus 4.8? Pro Token nicht: Die Preise sind identisch. Ihre Rechnung kann jedoch steigen, da Denken standardmäßig aktiviert ist und Standardantworten länger ausfallen. Messen Sie das Token-Volumen, anstatt von einer Parität auszugehen.
Gibt es einen Aufpreis für langen Kontext im 1M-Fenster? Nein. Das 1M-Token-Kontextfenster ist sowohl Standard als auch Maximum, und es gibt keine Premium-Stufe für lange Eingaben.
Was ist der günstigste Weg, Claude Opus 5 zu betreiben? Aggressiv cachen (das Minimum von 512 Tokens bedeutet, dass fast jedes wiederverwendete Präfix qualifiziert ist), nicht-dringende Aufträge über die Batch API für pauschal 50 % Rabatt ausführen und die Aufwandsstufen nach der niedrigsten überprüfen, die Ihre Evaluierungen besteht. Der kostenlose und günstigste Pfad-Leitfaden enthält weitere Informationen.
Kostet die regionale Bindung extra? Ja. Die Einstellung inference_geo: "us" wendet einen 1,1-fachen Multiplikator auf jede Token-Kategorie an, einschließlich Cache-Treffer und Batch.
