Um die Claude Haiku 5.5 API zu verwenden, senden Sie eine POST-Anfrage an https://api.anthropic.com/v1/messages mit "model": "claude-haiku-5-5", Ihrem Schlüssel im Header x-api-key und anthropic-version: 2023-06-01. Es kostet $0,10/$0,50 pro Million Input/Output-Tokens für Prompts bis zu 100K Tokens ($0,50/$2,50 darüber), liest bis zu 1M Tokens Kontext, schreibt bis zu 128K und verwendet standardmäßig medium Aufwand mit adaptiver Denkweise.
Anthropic veröffentlichte Haiku 5.5 am 7. Oktober 2026, und es ist das erste Haiku mit Aufwandsstufen (was ist Claude Haiku 5.5 behandelt Spezifikationen und Positionierung). Dieser Leitfaden behandelt einen ersten Aufruf in Curl, Python und TypeScript, dann Aufwand, Denken, Caching, Batch, Ablehnungen und Agenten-Toolsets. Sie können jede der folgenden Anfragen in Apidog speichern und überprüfen.
Claude Haiku 5.5 API auf einen Blick
| Parameter | Verhalten von Haiku 5.5 |
|---|---|
| Modell-ID | claude-haiku-5-5 (Bedrock: anthropic.claude-haiku-5-5); kein separater Alias |
| Preis pro MTok, Prompts bis zu 100K Tokens | $0,10 Eingabe, $0,50 Ausgabe, $0,01 Cache-Lesevorgänge |
| Preis pro MTok, Prompts über 100K Tokens | $0,50 Eingabe, $2,50 Ausgabe, $0,05 Cache-Lesevorgänge |
| Kontext / maximale Ausgabe | 1M / 128K; 300K im Batch mit dem Beta-Header output-300k-2026-03-24 |
output_config.effort |
low, medium (Standard), high, xhigh, max |
thinking |
Standardmäßig adaptive; disabled nur bei high Aufwand oder darunter |
thinking.display |
Leeres thinking-Feld standardmäßig; summarized gibt lesbaren Text zurück |
temperature, top_p, top_k |
Nicht-Standardwerte geben 400 zurück |
| Assistent-Prefill | Gibt 400 zurück, auch wenn das Denken deaktiviert ist |
| Minimaler cachebarer Prompt | 512 Tokens (4.096 bei Haiku 4.5) |
Quellen: die Haiku 5.5 Modellseite und die Claude API Preisdokumentation.
Ihr erster Claude Haiku 5.5 API-Aufruf
Erstellen Sie einen Schlüssel in der Claude Console (der Anthropic API Schlüssel-Leitfaden erklärt dies) und exportieren Sie ihn als ANTHROPIC_API_KEY. Fügen Sie den Schlüssel niemals direkt in den Code ein. Senden Sie dann Folgendes:
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 4096,
"output_config": {"effort": "medium"},
"thinking": {"type": "adaptive", "display": "summarized"},
"messages": [{"role": "user", "content": "Classify this ticket as billing, bug, or feature request: The export button times out on large projects."}]
}'
Das Python SDK übernimmt ANTHROPIC_API_KEY aus der Umgebung:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=4096,
output_config={"effort": "medium"},
thinking={"type": "adaptive", "display": "summarized"},
messages=[{"role": "user", "content": "Classify this ticket as billing, bug, or feature request: The export button times out on large projects."}],
)
for block in response.content:
if block.type == "thinking":
print("[thinking]", block.thinking)
elif block.type == "text":
print(block.text)
print(response.stop_reason, response.usage)
TypeScript folgt derselben Struktur:
import Anthropic from "@anthropic-ai/sdk";
const client = new Anthropic();
const response = await client.messages.create({
model: "claude-haiku-5-5",
max_tokens: 4096,
output_config: { effort: "medium" },
thinking: { type: "adaptive", display: "summarized" },
messages: [
{ role: "user", content: "Classify this ticket as billing, bug, or feature request: The export button times out on large projects." },
],
});
for (const block of response.content) {
if (block.type === "text") console.log(block.text);
}
console.log(response.stop_reason, response.usage);
Drei Gewohnheiten sorgen dafür, dass dieser Code funktioniert. Wählen Sie Inhaltsblöcke nach type aus, da eine Antwort mit einem thinking-Block beginnen kann und content[0].text dann fehlschlägt. Lassen Sie Spielraum bei max_tokens, da Thinking-Tokens darauf angerechnet werden. Und halten Sie den Anfragetext sauber: kein temperature, top_p, top_k, budget_tokens oder Assistent-Prefill. Jedes davon führt bei diesem Modell zu einem 400er-Fehler. Wenn Sie älteren Code migrieren, listet der Haiku 5.5 vs Haiku 4.5 Leitfaden jede breaking change mit Vorher/Nachher-JSON auf.
Wählen Sie eine Aufwandsstufe
Der Aufwand, festgelegt in output_config.effort, ist der Hauptregler für Qualität, Latenz und Kosten. Der Prompting-Leitfaden gibt diese Ausgangspunkte an:
low: die günstigste und schnellste Stufe für Chats, kurze Tool-Aufgaben und einfache, volumenstarke Anfragen.medium: der Standard. Beginnen Sie hier für die meisten Arbeiten, einschließlich agentischer Kodierung.high: Wissensarbeit, längere Agentenaufgaben und strikte Befolgung von Anweisungen.xhighundmax: nur dort, wo Ihre Evaluierungen einen Gewinn zeigen. Anthropic schlägt vor, dieselben Evaluierungen auf Claude Sonnet 5.5 durchzuführen und zu vergleichen.
Die Kostenkurve ist steil. Hier sind Anthropic's eigene OSWorld 2.1 (Offline-Subset) Läufe aus den Start-Charts, mit Teilergebnis und Kosten pro Versuch:
| Aufwand | Ergebnis | Kosten pro Versuch |
|---|---|---|
low |
42,0% | $0,0695 |
medium |
53,3% | $0,1257 |
high |
61,3% | $0,1827 |
xhigh |
67,6% | $0,2792 |
max |
72,4% | $0,6111 |
Der Wechsel von xhigh zu max verdoppelt die Kosten für weniger als fünf Punkte. Die Haiku 5.5 Benchmarks-Übersicht enthält die anderen Aufwandsdiagramme.
Eine Eigenheit: Bei xhigh in mehrstufigen Chats schreibt das Modell manchmal seine gesamte Antwort in seinen Denkprozess und beendet den Zug ohne sichtbaren Text. Überprüfen Sie auf eine leere Antwort, bevor Sie sie einem Benutzer anzeigen.
Denkprozess steuern
Adaptives Denken ist standardmäßig aktiviert, und zwei Dinge haben sich gegenüber Haiku 4.5 geändert. Erstens, die Standardanzeige verbirgt den Text. Jeder thinking-Block kommt mit einem leeren thinking-Feld und nur einer signature zurück. Setzen Sie "display": "summarized" (wie beim ersten Aufruf), wenn Sie lesbare Zusammenfassungen in Logs oder einer Benutzeroberfläche wünschen. Um weniger Denken zu erhalten, senken Sie den Aufwand; das Modell direkt zur Antwort aufzufordern, hat in Anthropic's Tests nicht dazu geführt, dass es aufhörte zu denken.
Zweitens können Sie den Denkprozess deaktivieren, aber nur bei high Aufwand oder darunter:
{
"model": "claude-haiku-5-5",
"max_tokens": 1024,
"thinking": {"type": "disabled"},
"output_config": {"effort": "low"},
"messages": [{"role": "user", "content": "Extract the invoice number from: INV-2291, due Nov 3."}]
}
Derselbe Body bei xhigh oder max gibt einen 400er-Fehler zurück. Eine erzwungene tool_choice (any oder ein benanntes Tool) wird akzeptiert, aber die Antwort beginnt mit dem Tool-Aufruf und enthält keinen Thinking-Block.
Für mehrstufige und Agenten-Schleifen geben Sie jeden Thinking-Block unverändert zurück und halten Sie den Verlauf nur im Anhang. Das Ändern von system, tools oder früheren messages vor einem zurückgegebenen Thinking-Block kann einen 400er-Fehler zurückgeben, und Thinking-Blöcke funktionieren nur in dem Konto, das sie erstellt hat (oder einem damit verknüpften).
Prompts cachen und Batch-Jobs
Caching macht Haiku 5.5 günstig. Für Prompts bis zu 100K Tokens kostet ein Cache-Lesevorgang $0,01 pro Million Tokens gegenüber $0,10 für frische Eingaben, ein 5-Minuten-Cache-Schreibvorgang kostet $0,125 und ein 1-Stunden-Schreibvorgang $0,20. Der minimale cachebare Prompt beträgt 512 Tokens, gegenüber 4.096 bei Haiku 4.5, sodass kurze System-Prompts und Tool-Listen jetzt qualifiziert sind. Markieren Sie das stabile Präfix mit cache_control:
{
"model": "claude-haiku-5-5",
"max_tokens": 1024,
"system": [{
"type": "text",
"text": "You are a support triage assistant. <long, stable policy text here>",
"cache_control": {"type": "ephemeral"}
}],
"messages": [{"role": "user", "content": "Ticket: refund not received after 10 days."}]
}
Das Ändern des übergeordneten effort zwischen Anfragen invalidiert den Cache; Aufwand pro Nachricht (Beta-Header mid-conversation-output-config-2026-07-01, Claude API und Google Cloud) behält ihn bei. Die Prompt-Caching-Dokumentation behandelt TTLs, und unser Prompt-Caching-Erklärer behandelt das Konzept.
Für Aufgaben, die warten können, reduziert die Message Batches API Input und Output um 50%: $0,05/$0,25 für Prompts bis zu 100K Tokens und $0,25/$1,25 darüber. Batch ist auch der einzige Weg zu 300K Output-Tokens, mit dem Beta-Header output-300k-2026-03-24.
Achten Sie auf die 100K-Grenze: „Ein Prompt von über 100.000 Tokens zahlt höhere Preise“, so Anthropic. Der Haiku 5.5 Preisleitfaden erläutert Beispiele auf beiden Seiten.
Behandlung des stop_reason „refusal“
Haiku 5.5 verwendet Sicherheitsklassifikatoren, die eine Anfrage ablehnen können, und es gibt keinen serverseitigen Fallback. Eine abgelehnte Anfrage kommt mit stop_reason: "refusal" zurück, und die Kategorien sind cyber, frontier_llm, bio und general_harms. Wenn Sie von Haiku 4.5 migrieren, sind diese Ablehnungen neu. Das erneute Senden derselben Anfrage führt normalerweise zu einer weiteren Ablehnung, also versuchen Sie es nicht blind erneut:
def run(client, messages):
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=4096,
messages=messages,
)
if response.stop_reason == "refusal":
details = getattr(response, "stop_details", None)
category = getattr(details, "category", "unknown")
log_refusal(category, messages) # Ihre Protokollierung
return {"status": "refused", "category": category}
text = "".join(b.text for b in response.content if b.type == "text")
return {"status": "ok", "text": text}
Verzweigen Sie bei stop_reason, bevor Sie content lesen, und leiten Sie Ablehnungen an eine Person oder ein anderes Modell in Ihrem eigenen Code weiter. Teams, die legitime Sicherheits- oder Biowissenschaftsarbeit leisten, die durch die cyber- oder bio-Klassifikatoren blockiert wird, können sich für das Anthropic's Cyber Verification Program oder Life Sciences Verification Program bewerben.
Computernutzung und Browsernutzung
Auf der Claude API und Google Cloud unterstützt Haiku 5.5 die Computernutzung nur über das Toolset computer_toolset_20260801, das keinen Beta-Header benötigt; die Deklaration von computer_20250124 führt zu einem 400er-Fehler. Die Browsernutzung erfolgt über browser_toolset_20260801, das Haiku 4.5 nicht unterstützt. Die Python- und TypeScript-SDKs haben am Starttag Beta-Klassen für beide hinzugefügt. Die Dokumentation zum Computer-Nutzungstool enthält die Mitgliedstools.
Ratenbegrenzungen
Haiku 5.5 hat die gleichen Ratenbegrenzungen wie Haiku 4.5: 1.000 Anfragen, 2M Input-Tokens und 400K Output-Tokens pro Minute im Start-Tier, bis zu 10.000 Anfragen, 10M Input und 2M Output im Scale-Tier. Der Priority-Tier wird nicht unterstützt. Für die Behandlung von 429er-Fehlern siehe den Leitfaden zur Überschreitung der Ratenbegrenzung.
Die Claude Haiku 5.5 API in Apidog testen
Gespeicherte Anfragen machen Aufwandsvergleiche und die Fehlersuche bei Ablehnungen wiederholbar. Hier ist das Setup in Apidog:

- Erstellen Sie eine Umgebung und fügen Sie
ANTHROPIC_API_KEYals geheime Variable hinzu. Verweisen Sie darauf als{{ANTHROPIC_API_KEY}}imx-api-key-Header, nebenanthropic-version: 2023-06-01undcontent-type: application/json. - Erstellen Sie eine POST-Anfrage an
https://api.anthropic.com/v1/messages, fügen Sie den Text des ersten Aufrufs ein und speichern Sie ihn. - Fügen Sie Assertionen hinzu: Status ist 200,
$.stop_reasonist gleichend_turn,$.usage.output_tokensist größer als 0, und$.content[*].typeenthälttext. Eine Ablehnung oder eine leerexhigh-Antwort lässt den Test nun fehlschlagen, anstatt unbemerkt zu bleiben. - Duplizieren Sie die Anfrage viermal mit
low,high,xhighundmaxund führen Sie den Ordner aus. Sie erhaltenusagefür jede Aufwandsstufe für Ihren eigenen Prompt. - Fügen Sie die Variante des gecachten System-Prompts hinzu und stellen Sie sicher, dass
$.usage.cache_read_input_tokensbeim zweiten Durchlauf größer als 0 ist.
Für umfassendere Muster siehe Testen von LLM-Anwendungen.
FAQ
Wie lautet die Claude Haiku 5.5 Modell-ID? claude-haiku-5-5, ohne Datumssuffix und ohne separaten Alias, auf der Claude API, Google Cloud, Microsoft Foundry und Claude Platform auf AWS. Auf Amazon Bedrock ist es anthropic.claude-haiku-5-5.
Gibt es eine kostenlose Claude Haiku 5.5 API? Es gibt keinen laufenden kostenlosen Tarif, aber neue API-Benutzer erhalten eine geringe Menge an kostenlosem Guthaben, um die API zu testen. Kostenlose Claude.ai-Benutzer können Haiku 5.5 im Chat auswählen, aber das ist kein API-Schlüssel. Max- und Team-Pläne beinhalten jetzt monatliche API-Credits. Der Leitfaden für den kostenlosen Zugang behandelt, was zählt und was nicht.
Warum gibt meine Haiku 4.5 Anfrage einen 400er-Fehler zurück? Prüfen Sie auf budget_tokens, eine Nicht-Standard-temperature oder top_p, jegliches top_k, einen Assistent-Prefill oder das alte Tool computer_20250124. Das sind die üblichen Ursachen.
Kann ich Haiku 5.5 in Claude Code verwenden? Ja, ab v2.1.293. Auf der Anthropic API löst der Alias haiku zu Haiku 5.5 auf. Siehe Claude Haiku 5.5 in Claude Code.
Sollte ich Haiku 5.5 oder Sonnet 5.5 für agentisches Codieren verwenden? Anthropic sagt, Sonnet 5.5 und Opus 5.5 „bleiben bessere Optionen für komplexe agentische Codierungsaufgaben.“ Verwenden Sie Haiku 5.5 für eng gefasste Aufgaben: Klassifizierung, Zusammenfassung, Komprimierung, Subagenten und Browsernutzung.
Nächster Schritt
Senden Sie die erste Anfrage mit medium, dann führen Sie sie mit low und high mit einem Prompt aus Ihrer eigenen Arbeitslast erneut aus und vergleichen Sie usage.output_tokens und die Antwortqualität. Laden Sie Apidog herunter, um alle drei Läufe mit Assertionen zu speichern, sodass die nächste Modellversion nur eine Feldänderung erfordert.
