Claude Sonnet 5.5 kostet 2 $/10 $ pro Million Input-/Output-Tokens, die Hälfte von Claude Opus 5.5s 4 $/20 $. Auf der Vergleichstabelle von Anthropic liegt es in den meisten Zeilen nur wenige Punkte hinter Opus 5.5 und übertrifft es bei Terminal-Bench 4.0 (70,6 % vs. 66,4 %), dennoch sagt Anthropic, dass Opus 5.5 „bei komplexen, ergebnisoffenen Aufgaben deutlich stärker bleibt“. Das Fazit: Routen Sie gut definierte, hochvolumige Aufgaben und Subagenten mit geringem bis hohem Aufwand an Sonnet 5.5. Zahlen Sie für Opus 5.5 bei langen, ergebnisoffenen Aufgaben oder überall dort, wo Sie Sonnet auf xhoch oder max pushen würden, da Opus bei mittlerem oder hohem Aufwand oft höhere Ergebnisse für ähnliches oder weniger Geld erzielt.
Für jedes Modell einzeln siehe Was ist Claude Sonnet 5.5 und Was ist Claude Opus 5.5. Der letzte Abschnitt zeigt, wie Sie beide mit Ihren eigenen Prompts in Apidog testen können.
Spezifikationen und Preise im Vergleich
| Sonnet 5.5 | Opus 5.5 | |
|---|---|---|
| API-Modell-ID | claude-sonnet-5-5 |
claude-opus-5-5 |
| Input / Output, pro 1 Mio. Tokens | 2 $ / 10 $ | 4 $ / 20 $ |
| Cache-Schreibvorgang (5 Min.) | 2,50 $ | 5 $ |
| Cache-Lesevorgang | 0,20 $ | 0,20 $ |
| Schnellmodus | Nicht verfügbar | 8 $ / 40 $ |
| Standard-Aufwand (API) | high |
medium |
| Denken | Standardmäßig adaptiv, oder between_tools |
Adaptiv, immer aktiv |
| Kontext / maximale Ausgabe | 1 Mio. / 128K | 1 Mio. / 128K |
| Latenzklasse | Schnell | Moderat |
Drei Zeilen sind am wichtigsten:
- Cache-Lesevorgänge kosten dasselbe, daher liegt in cache-intensiven Agenten-Schleifen der Unterschied hauptsächlich in Output- und Cache-Schreibvorgängen. Die Claude Sonnet 5.5 Preisgestaltung erklärt die Berechnung. Keines der Modelle berechnet einen Aufpreis für lange Kontexte.
- Standard-Aufwand unterscheidet sich. Ein Test mit Standardeinstellungen vergleicht Sonnet auf
highmit Opus aufmedium, die Paarung, bei der Opus tendenziell gewinnt. - Der Schnellmodus ist nur für Opus verfügbar (Dokumentation). Anthropic gibt an, dass Sonnet 5.5 eine um über 30 % schnellere Ausgabe generiert als Sonnet 5.
Benchmarks: nahe beieinander auf der Vergleichstabelle, größerer Abstand auf der Systemkarte
Die Zeilen eins bis acht stammen aus Anthropics Vergleichstabelle; der Rest aus der Systemkarte. Cognition führte FrontierCode aus, Cursor führte CursorBench aus, Zapier führte AutomationBench aus, und Artificial Analysis (AA) führte GDPval-AA und AA-Briefcase aus; Anthropic führte die anderen aus. Sonnet läuft, falls nicht anders angegeben, mit maximalem Aufwand.
| Benchmark | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4% (xhoch) |
| FrontierCode 1.1 Main | 46.2% max, 52.1% xhoch | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 (Elo) | 1844 | 1846 |
| AA-Briefcase v1.1 (Elo) | 1811 | 1822 |
| HLE, mit Tools | 64.5% | 67.7% |
| OSWorld 2.1, teilweise | 80.1% | 81.8% |
| Chartography, ohne Tools | 61.6% | 64.4% |
| SWE-Bench Pro | 81.3 | 89.9 |
| SWE-Bench Multimodal | 54.3 | 61.4 |
| HLE, ohne Tools | 56.9 | 64.4 |
| OSWorld 2.1, strenger Pass | 43.5% | 48.7% |
| ProgramBench, langer Kontext | 79.7% | 91.2% |
| Terminal-Bench-Science 0.1 | 59.9% | 58.7% |
| AutomationBench | 44.7 | 42.5 |
| HealthBench Professional | 69.2 | 65.6 |
Die Vergleichstabelle ist der schmeichelhafte Ausschnitt: Außerhalb von Terminal-Bench führt Opus in den prozentualen Zeilen mit 1,7 bis 3,2 Punkten, wenn man Sonnets xhoch FrontierCode-Ergebnis berücksichtigt. Fünf Zeilen der Systemkarte vergrößern den Abstand auf 5,2 bis 11,5 Punkte: SWE-Bench Pro, SWE-Bench Multimodal, HLE ohne Tools, strict OSWorld und ProgramBench mit langem Kontext. Lange, unassistierte Ganzaufgabenarbeit ist der Bereich, in dem Opus die Nase vorn hat.
Lesen Sie den Sieg bei Terminal-Bench 4.0 sorgfältig: Abschnitt 8.5 der Systemkarte besagt, dass der Safeguard-Fallback 10 % der Opus-Versuche im Vergleich zu 1,5 % bei Sonnet berührte, und AAs eigener Lauf bewertete Sonnet 5.5 mit 63,6 %. Details in Claude Sonnet 5.5 Benchmarks.
Der Aufwand entscheidet das Duell
Die Vergleichstabelle vergleicht jedes Modell in seiner besten Einstellung. Ihre Rechnung nicht. Anthropics Startseite zeigt jedes Aufwandsniveau mit den Kosten pro Versuch oder Aufgabe:
| Benchmark, Modell | Niedrig | Mittel | Hoch | Xhoch | Max |
|---|---|---|---|---|---|
| Terminal-Bench, Sonnet | 20.0% (0,76 $) | 28.8% (0,83 $) | 43.0% (1,94 $) | 61.5% (5,30 $) | 70.6% (12,54 $) |
| Terminal-Bench, Opus | 38.5% (1,29 $) | 57.6% (2,94 $) | 64.2% (3,88 $) | 66.4% (7,35 $) | 64.8% (11,24 $) |
| CursorBench, Sonnet | 35.8% (0,50 $) | 39.2% (0,70 $) | 47.8% (1,67 $) | 53.1% (3,88 $) | 55.5% (9,67 $) |
| CursorBench, Opus | 43.7% (1,17 $) | 52.5% (2,91 $) | 56.0% (3,97 $) | 56.0% (6,98 $) | 57.8% (13,43 $) |
| FrontierCode, Sonnet | 29.3% (0,19 $) | 36.5% (0,24 $) | 49.4% (0,42 $) | 52.1% (1,59 $) | 46.2% (20,78 $) |
| FrontierCode, Opus | 47.3% (0,40 $) | 54.6% (0,80 $) | 54.0% (1,09 $) | 51.4% (2,25 $) | 54.4% (6,19 $) |
| AA-Briefcase, Sonnet | 1264 (0,87 $) | 1461 (1,64 $) | 1634 (3,95 $) | 1746 (9,63 $) | 1811 (29,19 $) |
| AA-Briefcase, Opus | 1285 (1,15 $) | 1642 (4,40 $) | 1705 (6,27 $) | 1780 (12,27 $) | 1822 (21,05 $) |
Was es zeigt:
- Opus auf "Mittel" schlägt Sonnet auf "Hoch" oft. Terminal-Bench 4.0: Opus erzielt 57,6 % für 2,94 $ pro Versuch, Sonnet 43,0 % für 1,94 $.
- Opus unter "Max" kann Sonnets Bestleistung für weniger Geld übertreffen. CursorBench: Opus auf "Hoch" (56,0 %, 3,97 $) vs. Sonnet auf "Max" (55,5 %, 9,67 $). FrontierCode: Opus auf "Mittel" (54,6 %, 0,80 $) vs. Sonnets Beste (52,1 %, 1,59 $).
- Sonnet auf "Max" kann mehr kosten als Opus auf "Max": 29,19 $ vs. 21,05 $ bei AA-Briefcase, für einen niedrigeren Score. Bei FrontierCode fiel Sonnets Max-Score unter seinen Xhoch-Score, weil es die Überprüfung durch Subagenten aufgefächert hatte, so die Fußnote von Anthropic.
- Sonnet dominiert den unteren Bereich der Kurve. Seine niedrige Einstellung unterbietet Opus' günstigsten Punkt in jeder Tabelle.
Die Hälfte des Token-Preises ist nicht die Hälfte der Kosten pro Aufgabe: Sonnet verbraucht mehr Tokens, wenn der Aufwand steigt. AA-Daten, wie von OfficeChai berichtet, zeigen, dass Sonnet 5.5 bei maximalem Aufwand etwa 193.000 Output-Tokens pro Index-Aufgabe benötigt, was etwa 60 % mehr als Opus 5.5 ist.
Das ist die Hauptdiskussion im Hacker News Thread: Viele Kommentatoren interpretieren die Diagramme so, dass Opus bei geringerem Aufwand Sonnet bei hohem oder xhochem Aufwand erreicht oder unterbietet, wodurch Sonnets Nische bei niedrigem oder mittlerem Aufwand und als Subagent unter einem Opus-Orchestrator bleibt.
Anthropics Prompt-Leitfaden besagt, dass Sonnet 5.5s Aufwand neu kalibriert wird: Beginnen Sie mit high (medium für gut spezifizierte agentische Codierung) und sparen Sie sich xhigh und max für messbare Verbesserungen auf. Das Ändern des übergeordneten Aufwands zwischen Anfragen invalidiert den Prompt-Cache, daher sollte er pro Arbeitslast festgelegt werden (API-Leitfaden).
Sicherheits- und Verhaltensunterschiede
Die Ergebnisse der Prompt-Injection sind gespalten. Beim indirekten Prompt-Injection-Benchmark von Gray Swan beträgt die Angriffserfolgsrate von Sonnet 5.5 bei 15 Versuchen 3,4 % (Sonnet 5: 6,7 %): weniger resistent als Opus 5.5, aber mehr als jedes andere getestete Nicht-Claude-Modell, am schwächsten bei der GUI-Computernutzung (12,5 %). Gegen Shades adaptive Angreifer schlägt Sonnet Opus beim Coding (3,01 % vs. 54,61 % ohne Schutzmaßnahmen, 2,63 % vs. 11.13 % mit aktivierten Sonden) und erreicht Gleichstand bei der Computernutzung (0,07 %); bei der Browsernutzung ist es das erste von Anthropic bewertete Modell ohne erfolgreiche Angriffe. Siehe Opus 5.5 und Prompt-Injection.
Beide Modelle verfügen über Cyberschutzmaßnahmen; Sonnet 5.5 ist das erste Sonnet, das diese erhält. Als risikoreicher eingestufte Cyber-Aufgaben fallen auf Sonnet 5 zurück, automatisch in Anthropics Apps und über die API nur, wenn Sie sich dafür entscheiden (fallbacks: "default", Beta). Die Systemkarte warnt vor mehr Ablehnungen auch bei harmlosen Sicherheitsarbeiten.
Die Systemkarte stellt auch fest, dass Sonnet 5.5 unter Druck ehrlicher ist als Opus 5.5, aber anfälliger für Halluzinationen.
Mischen von Sonnet 5.5 und Opus 5.5 in einem System
Eine Möglichkeit, beides zu nutzen: Opus plant, Sonnet führt aus. Drei Mechanismen sind wichtig.
- Denkblöcke überschneiden sich nicht. Sonnet 5.5 verwirft Opus 5- und Opus 5.5-Denkblöcke (nicht abgerechnet; die Anfrage liefert immer noch 200 zurück), und Blöcke sind an Modell, Konversation und Konto gebunden. Wechselt man das Modell mitten in einer Konversation, geht die Argumentation verloren, daher Übergabe über Text: Opus schreibt den Plan als Nachricht, Sonnet beginnt damit (Migrationsleitfaden).
- Das Berater-Tool akzeptiert Opus 5.5 als Berater für einen Sonnet 5.5-Executor; Ratschläge werden verschlüsselt als
advisor_redacted_resultzurückgegeben. - Claude Code hat
opusplan: Opus im Plan-Modus, Sonnet für die Ausführung. Der Aliassonnetbedeutet Sonnet 5.5 nur auf der Anthropic API (v2.1.284 oder höher), daher wird auf Bedrock, Google Cloud und Foundryopusplanauf einem älteren Sonnet ausgeführt. Siehe Claude Sonnet 5.5 in Claude Code.
Wo GPT-6 Sol passt
GPT-6 Sol teilt sich den Listenpreis von Sonnet 5.5 von 2 $/10 $, mit 0,20 $ für Cache-Lesevorgänge (90 % Rabatt) und einem 872k Kontextfenster. Anthropics Tabelle weist Sol vier Zellen zu: FrontierCode 49,3 %, GDPval-AA 1487, AA-Briefcase 1483 und Chartography 53,6 % ohne Tools. Eine Fußnote besagt, dass OpenAI kürzlich einen Fehler bei der Bilderkennung von Sol behoben hat, der sich möglicherweise noch nicht in den AA- und Surge AI-Scores widerspiegelt.
Die Kosten pro Aufgabe kehren sich je nach Benchmark um. Bei AA-Briefcase auf Max kostet Sol 2,67 $ pro Aufgabe gegenüber Sonnet’s 29,19 $, wobei es 1483 zu 1811 erzielt. Bei FrontierCode erreicht Sonnet auf Hoch Sols Bestleistung (49,4 % vs. 49,3 %) für 0,42 $ gegenüber 2,07 $. Siehe GPT-6 Sol vs. Claude Opus 5.5 und Was ist GPT-6 Sol.
Welches Modell für welche Arbeitslast
| Arbeitslast | Modell und Aufwand |
|---|---|
| Hochvolumiger Chat, Klassifizierung, Extraktion | Sonnet 5.5, niedrig oder mittel |
| Gut definierte Fehlerbehebungen, PR-große Änderungen | Sonnet 5.5, mittel oder hoch |
| Subagenten, die einen Opus-Plan ausführen | Sonnet 5.5, mittel oder hoch |
| Lange, ergebnisoffene agentische Arbeit | Opus 5.5, mittel dann hoch |
Alles, was Sonnet auf xhoch oder max benötigt |
Opus 5.5, mittel oder hoch |
| Codebasis-Begründung mit langem Kontext | Opus 5.5, mittel oder höher |
| Agenten, die nicht vertrauenswürdige Inhalte lesen | Beides; testen Sie Ihre eigenen Injection-Fälle |
Testen Sie beide mit Ihrem eigenen Traffic
Jedes der obigen Diagramme stammt aus der Testumgebung eines anderen, nicht von Ihren Prompts, Tools oder Ihrer Token-Mischung. Beginnen Sie mit der Paarung, die die Daten hervorheben:
ask() {
curl -s https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"'"$1"'","max_tokens":16000,
"output_config":{"effort":"'"$2"'"},
"messages":[{"role":"user","content":"Review this diff and list each bug as JSON: ..."}]}' \
| jq '{model, stop_reason, usage}'
}
ask claude-sonnet-5-5 high
ask claude-opus-5-5 medium
Machen Sie es in Apidog wiederholbar: eine Anfrage an https://api.anthropic.com/v1/messages, ANTHROPIC_API_KEY als Umgebungsvariable und {{model}} sowie {{effort}} im Body. Duplizieren Sie dies pro Paarung und fügen Sie einen Post-Processor hinzu, damit jeder Lauf die gleichen Dinge überprüft:
const body = pm.response.json();
pm.test("finished cleanly", () => {
pm.expect(body.stop_reason).to.not.be.oneOf(["max_tokens", "refusal"]);
});
pm.test("stays inside the token budget", () => {
pm.expect(body.usage.output_tokens).to.be.below(8000);
});
Führen Sie jedes Paar 10 bis 20 Mal aus und vergleichen Sie usage, Antwortzeit und Erfolgsrate; Tokens mal Listenpreis ist Ihre tatsächliche Kosten pro Aufgabe. Mehr dazu in So testen Sie LLM-Anwendungen.
FAQ
Ist Claude Sonnet 5.5 besser als Opus 5.5? In den meisten Zeilen nicht. Opus 5.5 führt die Vergleichstabelle an, außer bei Terminal-Bench 4.0 und einem knappen Unentschieden bei GDPval-AA. Der Vergleich der letzten Generation: Claude Opus 5 vs. Sonnet 5.
Kostet Sonnet 5.5 die Hälfte von Opus 5.5? Pro Token, ja. Pro Aufgabe hängt es vom Aufwand ab: bei maximalem Aufwand kostete Sonnet bei AA-Briefcase mehr (29,19 $ vs. 21,05 $).
Kann ich Modelle mitten im Gespräch wechseln? Ja, aber Sonnet 5.5 verwirft die Denkblöcke von Opus 5.5, übergeben Sie den Zustand daher als Text.
Sonnet 5.5 oder GPT-6 Sol für 2 $/10 $? Sonnet führt in allen vier gemeinsamen Zeilen bei seiner besten Einstellung; Sol kann pro Aufgabe wesentlich günstiger sein. Testen Sie beide.
Nächster Schritt
Führen Sie Ihre zwei teuersten Prompts mit Sonnet 5.5 auf hoch und Opus 5.5 auf mittel aus und vergleichen Sie Erfolgsrate und Kosten pro Aufgabe, bevor Sie eine Routing-Regel ändern. Um Anfragen, Zusicherungen und Ergebnisse in einem Projekt zu speichern, laden Sie Apidog herunter.
