Wie verwende ich die Claude Haiku 5.5 API?

Claude Haiku 5.5 API-Leitfaden: Erster Aufruf mit claude-haiku-5-5 in curl, Python und TypeScript, sowie Aufwand, Überlegungen, Caching, Batch und Ablehnungen.

INEZA Felin-Michel

INEZA Felin-Michel

8 October 2026

Wie verwende ich die Claude Haiku 5.5 API?

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Um die Claude Haiku 5.5 API zu verwenden, senden Sie eine POST-Anfrage an https://api.anthropic.com/v1/messages mit "model": "claude-haiku-5-5", Ihrem Schlüssel im Header x-api-key und anthropic-version: 2023-06-01. Es kostet $0,10/$0,50 pro Million Input/Output-Tokens für Prompts bis zu 100K Tokens ($0,50/$2,50 darüber), liest bis zu 1M Tokens Kontext, schreibt bis zu 128K und verwendet standardmäßig medium Aufwand mit adaptiver Denkweise.

Anthropic veröffentlichte Haiku 5.5 am 7. Oktober 2026, und es ist das erste Haiku mit Aufwandsstufen (was ist Claude Haiku 5.5 behandelt Spezifikationen und Positionierung). Dieser Leitfaden behandelt einen ersten Aufruf in Curl, Python und TypeScript, dann Aufwand, Denken, Caching, Batch, Ablehnungen und Agenten-Toolsets. Sie können jede der folgenden Anfragen in Apidog speichern und überprüfen.

button

Claude Haiku 5.5 API auf einen Blick

Parameter Verhalten von Haiku 5.5
Modell-ID claude-haiku-5-5 (Bedrock: anthropic.claude-haiku-5-5); kein separater Alias
Preis pro MTok, Prompts bis zu 100K Tokens $0,10 Eingabe, $0,50 Ausgabe, $0,01 Cache-Lesevorgänge
Preis pro MTok, Prompts über 100K Tokens $0,50 Eingabe, $2,50 Ausgabe, $0,05 Cache-Lesevorgänge
Kontext / maximale Ausgabe 1M / 128K; 300K im Batch mit dem Beta-Header output-300k-2026-03-24
output_config.effort low, medium (Standard), high, xhigh, max
thinking Standardmäßig adaptive; disabled nur bei high Aufwand oder darunter
thinking.display Leeres thinking-Feld standardmäßig; summarized gibt lesbaren Text zurück
temperature, top_p, top_k Nicht-Standardwerte geben 400 zurück
Assistent-Prefill Gibt 400 zurück, auch wenn das Denken deaktiviert ist
Minimaler cachebarer Prompt 512 Tokens (4.096 bei Haiku 4.5)

Quellen: die Haiku 5.5 Modellseite und die Claude API Preisdokumentation.

Ihr erster Claude Haiku 5.5 API-Aufruf

Erstellen Sie einen Schlüssel in der Claude Console (der Anthropic API Schlüssel-Leitfaden erklärt dies) und exportieren Sie ihn als ANTHROPIC_API_KEY. Fügen Sie den Schlüssel niemals direkt in den Code ein. Senden Sie dann Folgendes:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 4096,
    "output_config": {"effort": "medium"},
    "thinking": {"type": "adaptive", "display": "summarized"},
    "messages": [{"role": "user", "content": "Classify this ticket as billing, bug, or feature request: The export button times out on large projects."}]
  }'

Das Python SDK übernimmt ANTHROPIC_API_KEY aus der Umgebung:

import anthropic

client = anthropic.Anthropic()
response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    thinking={"type": "adaptive", "display": "summarized"},
    messages=[{"role": "user", "content": "Classify this ticket as billing, bug, or feature request: The export button times out on large projects."}],
)

for block in response.content:
    if block.type == "thinking":
        print("[thinking]", block.thinking)
    elif block.type == "text":
        print(block.text)
print(response.stop_reason, response.usage)

TypeScript folgt derselben Struktur:

import Anthropic from "@anthropic-ai/sdk";

const client = new Anthropic();
const response = await client.messages.create({
  model: "claude-haiku-5-5",
  max_tokens: 4096,
  output_config: { effort: "medium" },
  thinking: { type: "adaptive", display: "summarized" },
  messages: [
    { role: "user", content: "Classify this ticket as billing, bug, or feature request: The export button times out on large projects." },
  ],
});

for (const block of response.content) {
  if (block.type === "text") console.log(block.text);
}
console.log(response.stop_reason, response.usage);

Drei Gewohnheiten sorgen dafür, dass dieser Code funktioniert. Wählen Sie Inhaltsblöcke nach type aus, da eine Antwort mit einem thinking-Block beginnen kann und content[0].text dann fehlschlägt. Lassen Sie Spielraum bei max_tokens, da Thinking-Tokens darauf angerechnet werden. Und halten Sie den Anfragetext sauber: kein temperature, top_p, top_k, budget_tokens oder Assistent-Prefill. Jedes davon führt bei diesem Modell zu einem 400er-Fehler. Wenn Sie älteren Code migrieren, listet der Haiku 5.5 vs Haiku 4.5 Leitfaden jede breaking change mit Vorher/Nachher-JSON auf.

Wählen Sie eine Aufwandsstufe

Der Aufwand, festgelegt in output_config.effort, ist der Hauptregler für Qualität, Latenz und Kosten. Der Prompting-Leitfaden gibt diese Ausgangspunkte an:

Die Kostenkurve ist steil. Hier sind Anthropic's eigene OSWorld 2.1 (Offline-Subset) Läufe aus den Start-Charts, mit Teilergebnis und Kosten pro Versuch:

Aufwand Ergebnis Kosten pro Versuch
low 42,0% $0,0695
medium 53,3% $0,1257
high 61,3% $0,1827
xhigh 67,6% $0,2792
max 72,4% $0,6111

Der Wechsel von xhigh zu max verdoppelt die Kosten für weniger als fünf Punkte. Die Haiku 5.5 Benchmarks-Übersicht enthält die anderen Aufwandsdiagramme.

Eine Eigenheit: Bei xhigh in mehrstufigen Chats schreibt das Modell manchmal seine gesamte Antwort in seinen Denkprozess und beendet den Zug ohne sichtbaren Text. Überprüfen Sie auf eine leere Antwort, bevor Sie sie einem Benutzer anzeigen.

Denkprozess steuern

Adaptives Denken ist standardmäßig aktiviert, und zwei Dinge haben sich gegenüber Haiku 4.5 geändert. Erstens, die Standardanzeige verbirgt den Text. Jeder thinking-Block kommt mit einem leeren thinking-Feld und nur einer signature zurück. Setzen Sie "display": "summarized" (wie beim ersten Aufruf), wenn Sie lesbare Zusammenfassungen in Logs oder einer Benutzeroberfläche wünschen. Um weniger Denken zu erhalten, senken Sie den Aufwand; das Modell direkt zur Antwort aufzufordern, hat in Anthropic's Tests nicht dazu geführt, dass es aufhörte zu denken.

Zweitens können Sie den Denkprozess deaktivieren, aber nur bei high Aufwand oder darunter:

{
  "model": "claude-haiku-5-5",
  "max_tokens": 1024,
  "thinking": {"type": "disabled"},
  "output_config": {"effort": "low"},
  "messages": [{"role": "user", "content": "Extract the invoice number from: INV-2291, due Nov 3."}]
}

Derselbe Body bei xhigh oder max gibt einen 400er-Fehler zurück. Eine erzwungene tool_choice (any oder ein benanntes Tool) wird akzeptiert, aber die Antwort beginnt mit dem Tool-Aufruf und enthält keinen Thinking-Block.

Für mehrstufige und Agenten-Schleifen geben Sie jeden Thinking-Block unverändert zurück und halten Sie den Verlauf nur im Anhang. Das Ändern von system, tools oder früheren messages vor einem zurückgegebenen Thinking-Block kann einen 400er-Fehler zurückgeben, und Thinking-Blöcke funktionieren nur in dem Konto, das sie erstellt hat (oder einem damit verknüpften).

Prompts cachen und Batch-Jobs

Caching macht Haiku 5.5 günstig. Für Prompts bis zu 100K Tokens kostet ein Cache-Lesevorgang $0,01 pro Million Tokens gegenüber $0,10 für frische Eingaben, ein 5-Minuten-Cache-Schreibvorgang kostet $0,125 und ein 1-Stunden-Schreibvorgang $0,20. Der minimale cachebare Prompt beträgt 512 Tokens, gegenüber 4.096 bei Haiku 4.5, sodass kurze System-Prompts und Tool-Listen jetzt qualifiziert sind. Markieren Sie das stabile Präfix mit cache_control:

{
  "model": "claude-haiku-5-5",
  "max_tokens": 1024,
  "system": [{
    "type": "text",
    "text": "You are a support triage assistant. <long, stable policy text here>",
    "cache_control": {"type": "ephemeral"}
  }],
  "messages": [{"role": "user", "content": "Ticket: refund not received after 10 days."}]
}

Das Ändern des übergeordneten effort zwischen Anfragen invalidiert den Cache; Aufwand pro Nachricht (Beta-Header mid-conversation-output-config-2026-07-01, Claude API und Google Cloud) behält ihn bei. Die Prompt-Caching-Dokumentation behandelt TTLs, und unser Prompt-Caching-Erklärer behandelt das Konzept.

Für Aufgaben, die warten können, reduziert die Message Batches API Input und Output um 50%: $0,05/$0,25 für Prompts bis zu 100K Tokens und $0,25/$1,25 darüber. Batch ist auch der einzige Weg zu 300K Output-Tokens, mit dem Beta-Header output-300k-2026-03-24.

Achten Sie auf die 100K-Grenze: „Ein Prompt von über 100.000 Tokens zahlt höhere Preise“, so Anthropic. Der Haiku 5.5 Preisleitfaden erläutert Beispiele auf beiden Seiten.

Behandlung des stop_reason „refusal“

Haiku 5.5 verwendet Sicherheitsklassifikatoren, die eine Anfrage ablehnen können, und es gibt keinen serverseitigen Fallback. Eine abgelehnte Anfrage kommt mit stop_reason: "refusal" zurück, und die Kategorien sind cyber, frontier_llm, bio und general_harms. Wenn Sie von Haiku 4.5 migrieren, sind diese Ablehnungen neu. Das erneute Senden derselben Anfrage führt normalerweise zu einer weiteren Ablehnung, also versuchen Sie es nicht blind erneut:

def run(client, messages):
    response = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=4096,
        messages=messages,
    )
    if response.stop_reason == "refusal":
        details = getattr(response, "stop_details", None)
        category = getattr(details, "category", "unknown")
        log_refusal(category, messages)  # Ihre Protokollierung
        return {"status": "refused", "category": category}
    text = "".join(b.text for b in response.content if b.type == "text")
    return {"status": "ok", "text": text}

Verzweigen Sie bei stop_reason, bevor Sie content lesen, und leiten Sie Ablehnungen an eine Person oder ein anderes Modell in Ihrem eigenen Code weiter. Teams, die legitime Sicherheits- oder Biowissenschaftsarbeit leisten, die durch die cyber- oder bio-Klassifikatoren blockiert wird, können sich für das Anthropic's Cyber Verification Program oder Life Sciences Verification Program bewerben.

Computernutzung und Browsernutzung

Auf der Claude API und Google Cloud unterstützt Haiku 5.5 die Computernutzung nur über das Toolset computer_toolset_20260801, das keinen Beta-Header benötigt; die Deklaration von computer_20250124 führt zu einem 400er-Fehler. Die Browsernutzung erfolgt über browser_toolset_20260801, das Haiku 4.5 nicht unterstützt. Die Python- und TypeScript-SDKs haben am Starttag Beta-Klassen für beide hinzugefügt. Die Dokumentation zum Computer-Nutzungstool enthält die Mitgliedstools.

Ratenbegrenzungen

Haiku 5.5 hat die gleichen Ratenbegrenzungen wie Haiku 4.5: 1.000 Anfragen, 2M Input-Tokens und 400K Output-Tokens pro Minute im Start-Tier, bis zu 10.000 Anfragen, 10M Input und 2M Output im Scale-Tier. Der Priority-Tier wird nicht unterstützt. Für die Behandlung von 429er-Fehlern siehe den Leitfaden zur Überschreitung der Ratenbegrenzung.

Die Claude Haiku 5.5 API in Apidog testen

Gespeicherte Anfragen machen Aufwandsvergleiche und die Fehlersuche bei Ablehnungen wiederholbar. Hier ist das Setup in Apidog:

  1. Erstellen Sie eine Umgebung und fügen Sie ANTHROPIC_API_KEY als geheime Variable hinzu. Verweisen Sie darauf als {{ANTHROPIC_API_KEY}} im x-api-key-Header, neben anthropic-version: 2023-06-01 und content-type: application/json.
  2. Erstellen Sie eine POST-Anfrage an https://api.anthropic.com/v1/messages, fügen Sie den Text des ersten Aufrufs ein und speichern Sie ihn.
  3. Fügen Sie Assertionen hinzu: Status ist 200, $.stop_reason ist gleich end_turn, $.usage.output_tokens ist größer als 0, und $.content[*].type enthält text. Eine Ablehnung oder eine leere xhigh-Antwort lässt den Test nun fehlschlagen, anstatt unbemerkt zu bleiben.
  4. Duplizieren Sie die Anfrage viermal mit low, high, xhigh und max und führen Sie den Ordner aus. Sie erhalten usage für jede Aufwandsstufe für Ihren eigenen Prompt.
  5. Fügen Sie die Variante des gecachten System-Prompts hinzu und stellen Sie sicher, dass $.usage.cache_read_input_tokens beim zweiten Durchlauf größer als 0 ist.

Für umfassendere Muster siehe Testen von LLM-Anwendungen.

FAQ

Wie lautet die Claude Haiku 5.5 Modell-ID? claude-haiku-5-5, ohne Datumssuffix und ohne separaten Alias, auf der Claude API, Google Cloud, Microsoft Foundry und Claude Platform auf AWS. Auf Amazon Bedrock ist es anthropic.claude-haiku-5-5.

Gibt es eine kostenlose Claude Haiku 5.5 API? Es gibt keinen laufenden kostenlosen Tarif, aber neue API-Benutzer erhalten eine geringe Menge an kostenlosem Guthaben, um die API zu testen. Kostenlose Claude.ai-Benutzer können Haiku 5.5 im Chat auswählen, aber das ist kein API-Schlüssel. Max- und Team-Pläne beinhalten jetzt monatliche API-Credits. Der Leitfaden für den kostenlosen Zugang behandelt, was zählt und was nicht.

Warum gibt meine Haiku 4.5 Anfrage einen 400er-Fehler zurück? Prüfen Sie auf budget_tokens, eine Nicht-Standard-temperature oder top_p, jegliches top_k, einen Assistent-Prefill oder das alte Tool computer_20250124. Das sind die üblichen Ursachen.

Kann ich Haiku 5.5 in Claude Code verwenden? Ja, ab v2.1.293. Auf der Anthropic API löst der Alias haiku zu Haiku 5.5 auf. Siehe Claude Haiku 5.5 in Claude Code.

Sollte ich Haiku 5.5 oder Sonnet 5.5 für agentisches Codieren verwenden? Anthropic sagt, Sonnet 5.5 und Opus 5.5 „bleiben bessere Optionen für komplexe agentische Codierungsaufgaben.“ Verwenden Sie Haiku 5.5 für eng gefasste Aufgaben: Klassifizierung, Zusammenfassung, Komprimierung, Subagenten und Browsernutzung.

Nächster Schritt

Senden Sie die erste Anfrage mit medium, dann führen Sie sie mit low und high mit einem Prompt aus Ihrer eigenen Arbeitslast erneut aus und vergleichen Sie usage.output_tokens und die Antwortqualität. Laden Sie Apidog herunter, um alle drei Läufe mit Assertionen zu speichern, sodass die nächste Modellversion nur eine Feldänderung erfordert.

button

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen