Para usar la API de Claude Haiku 5.5, envíe una solicitud POST a https://api.anthropic.com/v1/messages con "model": "claude-haiku-5-5", su clave en el encabezado x-api-key, y anthropic-version: 2023-06-01. Cuesta $0.10/$0.50 por millón de tokens de entrada/salida para prompts de hasta 100K tokens ($0.50/$2.50 por encima de eso), lee hasta 1M de tokens de contexto, escribe hasta 128K, y por defecto usa un esfuerzo medium con pensamiento adaptativo activado.
Anthropic lanzó Haiku 5.5 el 7 de octubre de 2026, y es el primer Haiku con niveles de esfuerzo (qué es Claude Haiku 5.5 cubre especificaciones y posicionamiento). Esta guía cubre una primera llamada en curl, Python y TypeScript, luego el esfuerzo, el pensamiento, el almacenamiento en caché, el procesamiento por lotes, las denegaciones y los conjuntos de herramientas de agente. Puede guardar y afirmar cada solicitud a continuación en Apidog.
API de Claude Haiku 5.5 de un vistazo
| Parámetro | Comportamiento de Haiku 5.5 |
|---|---|
| ID del Modelo | claude-haiku-5-5 (Bedrock: anthropic.claude-haiku-5-5); sin alias separado |
| Precio por MTok, prompts de hasta 100K tokens | $0.10 entrada, $0.50 salida, $0.01 lecturas de caché |
| Precio por MTok, prompts de más de 100K tokens | $0.50 entrada, $2.50 salida, $0.05 lecturas de caché |
| Contexto / salida máxima | 1M / 128K; 300K en Batch con el encabezado beta output-300k-2026-03-24 |
output_config.effort |
low (bajo), medium (medio, predeterminado), high (alto), xhigh (muy alto), max (máximo) |
thinking |
adaptive (adaptativo) por defecto; disabled (desactivado) solo con esfuerzo high o inferior |
thinking.display |
Campo thinking vacío por defecto; summarized (resumido) devuelve texto legible |
temperature, top_p, top_k |
Valores no predeterminados devuelven 400 |
| Prefill del asistente | Devuelve 400, incluso con el pensamiento desactivado |
| Prompt mínimo cacheable | 512 tokens (4,096 en Haiku 4.5) |
Fuentes: la página del modelo Haiku 5.5 y la documentación de precios de la API de Claude.
Su primera llamada a la API de Claude Haiku 5.5
Cree una clave en la Consola de Claude (la guía de claves de API de Anthropic explica cómo hacerlo) y expórtela como ANTHROPIC_API_KEY. Nunca pegue la clave en el código. Luego envíe esto:
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 4096,
"output_config": {"effort": "medium"},
"thinking": {"type": "adaptive", "display": "summarized"},
"messages": [{"role": "user", "content": "Classify this ticket as billing, bug, or feature request: The export button times out on large projects."}]
}'
El SDK de Python toma ANTHROPIC_API_KEY del entorno:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=4096,
output_config={"effort": "medium"},
thinking={"type": "adaptive", "display": "summarized"},
messages=[{"role": "user", "content": "Classify this ticket as billing, bug, or feature request: The export button times out on large projects."}],
)
for block in response.content:
if block.type == "thinking":
print("[thinking]", block.thinking)
elif block.type == "text":
print(block.text)
print(response.stop_reason, response.usage)
TypeScript sigue la misma estructura:
import Anthropic from "@anthropic-ai/sdk";
const client = new Anthropic();
const response = await client.messages.create({
model: "claude-haiku-5-5",
max_tokens: 4096,
output_config: { effort: "medium" },
thinking: { type: "adaptive", display: "summarized" },
messages: [
{ role: "user", content: "Classify this ticket as billing, bug, or feature request: The export button times out on large projects." },
],
});
for (const block of response.content) {
if (block.type === "text") console.log(block.text);
}
console.log(response.stop_reason, response.usage);
Tres hábitos mantienen este código funcionando. Seleccione bloques de contenido por type, porque una respuesta puede abrirse con un bloque thinking y content[0].text falla. Deje margen en max_tokens, porque los tokens de pensamiento cuentan para ello. Y mantenga el cuerpo de la solicitud limpio: sin temperature, top_p, top_k, budget_tokens o prefill del asistente. Cada uno de ellos es un 400 en este modelo. Si está migrando código antiguo, la guía Haiku 5.5 vs Haiku 4.5 enumera cada cambio disruptivo con JSON antes/después.
Elija un nivel de esfuerzo
El esfuerzo, configurado en output_config.effort, es el dial principal para la calidad, la latencia y el costo. La guía de prompts ofrece estos puntos de partida:
low: el nivel más barato y rápido, para chat, tareas de herramientas cortas y solicitudes simples de alto volumen.medium: el predeterminado. Comience aquí para la mayoría de los trabajos, incluida la codificación agéntica.high: trabajo de conocimiento, tareas de agente más largas y seguimiento estricto de instrucciones.xhighymax: solo donde sus evaluaciones muestren una ganancia. Anthropic sugiere ejecutar las mismas evaluaciones en Claude Sonnet 5.5 y comparar.
La curva de costos es pronunciada. Aquí están las propias ejecuciones de Anthropic de OSWorld 2.1 (subconjunto offline) de los gráficos de lanzamiento, con puntuación de crédito parcial y costo por intento:
| Esfuerzo | Puntuación | Costo por intento |
|---|---|---|
low |
42.0% | $0.0695 |
medium |
53.3% | $0.1257 |
high |
61.3% | $0.1827 |
xhigh |
67.6% | $0.2792 |
max |
72.4% | $0.6111 |
Pasar de xhigh a max más que duplica el costo por menos de cinco puntos. El desglose de los benchmarks de Haiku 5.5 tiene los otros gráficos por esfuerzo.
Una peculiaridad: en xhigh en chats de varias interacciones, el modelo a veces escribe toda su respuesta en su pensamiento y termina la interacción sin texto visible. Verifique si hay una respuesta vacía antes de mostrársela a un usuario.
Controlar el pensamiento
El pensamiento adaptativo está activado por defecto, y dos cosas cambiaron desde Haiku 4.5. Primero, la visualización predeterminada oculta el texto. Cada bloque thinking vuelve con un campo thinking vacío y solo una signature. Establezca "display": "summarized" (como en la primera llamada) cuando quiera resúmenes legibles en los registros o una interfaz de usuario. Para obtener menos pensamiento, baje el esfuerzo; pedirle al modelo que responda directamente no lo detuvo en las pruebas de Anthropic.
Segundo, puede desactivar el pensamiento, pero solo con un esfuerzo high o inferior:
{
"model": "claude-haiku-5-5",
"max_tokens": 1024,
"thinking": {"type": "disabled"},
"output_config": {"effort": "low"},
"messages": [{"role": "user", "content": "Extract the invoice number from: INV-2291, due Nov 3."}]
}
El mismo cuerpo en xhigh o max devuelve un 400. Se acepta una tool_choice forzada (any o una herramienta con nombre), pero la respuesta comienza con la llamada a la herramienta y no lleva un bloque de pensamiento.
Para bucles multi-interacción y de agente, pase cada bloque de pensamiento sin cambios y mantenga el historial de solo añadir. Cambiar system, tools o messages anteriores antes de un bloque de pensamiento devuelto puede devolver un 400, y los bloques de pensamiento solo funcionan en la cuenta que los produjo (o una vinculada a ella).
Caché de prompts y trabajos por lotes
El almacenamiento en caché es donde Haiku 5.5 se vuelve económico. Para prompts de hasta 100K tokens, una lectura de caché cuesta $0.01 por millón de tokens frente a $0.10 para entrada nueva, una escritura de caché de 5 minutos cuesta $0.125 y una escritura de 1 hora $0.20. El prompt mínimo cacheable es de 512 tokens, por debajo de los 4,096 en Haiku 4.5, por lo que los prompts de sistema cortos y las listas de herramientas ahora califican. Marque el prefijo estable con cache_control:
{
"model": "claude-haiku-5-5",
"max_tokens": 1024,
"system": [{
"type": "text",
"text": "You are a support triage assistant. <long, stable policy text here>",
"cache_control": {"type": "ephemeral"}
}],
"messages": [{"role": "user", "content": "Ticket: refund not received after 10 days."}]
}
Cambiar el effort de nivel superior entre solicitudes invalida la caché; el esfuerzo por mensaje (encabezado beta mid-conversation-output-config-2026-07-01, API de Claude y Google Cloud) lo mantiene. La documentación de caché de prompts cubre los TTL, y nuestro explicador de caché de prompts cubre el concepto.
Para trabajos que pueden esperar, la API de Message Batches reduce la entrada y salida en un 50%: $0.05/$0.25 para prompts de hasta 100K tokens y $0.25/$1.25 por encima. El procesamiento por lotes es también la única vía para 300K tokens de salida, con el encabezado beta output-300k-2026-03-24.
Preste atención a la línea de 100K: "un prompt de más de 100,000 tokens paga precios más altos", en palabras de Anthropic. La guía de precios de Haiku 5.5 explica ejemplos en ambos lados.
Manejar stop_reason "refusal" (rechazo)
Haiku 5.5 ejecuta clasificadores de seguridad que pueden rechazar una solicitud, y no tiene un fallback en el lado del servidor. Una solicitud rechazada regresa con stop_reason: "refusal", y las categorías son cyber, frontier_llm, bio y general_harms. Si está migrando de Haiku 4.5, estos rechazos son nuevos. Enviar la misma solicitud de nuevo suele devolver otro rechazo, así que no lo intente ciegamente:
def run(client, messages):
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=4096,
messages=messages,
)
if response.stop_reason == "refusal":
details = getattr(response, "stop_details", None)
category = getattr(details, "category", "unknown")
log_refusal(category, messages) # su registro
return {"status": "refused", "category": category}
text = "".join(b.text for b in response.content if b.type == "text")
return {"status": "ok", "text": text}
Ramifique en stop_reason antes de leer content, y dirija los rechazos a una persona o a otro modelo en su propio código. Los equipos que realizan trabajos legítimos de seguridad o ciencias de la vida bloqueados por los clasificadores cyber o bio pueden solicitar el Programa de Verificación Cibernética o el Programa de Verificación de Ciencias de la Vida de Anthropic.
Uso de computadora y uso de navegador
En la API de Claude y Google Cloud, Haiku 5.5 soporta el uso de computadora solo a través del conjunto de herramientas computer_toolset_20260801, que no necesita un encabezado beta; declarar computer_20250124 devuelve un 400. El uso del navegador se realiza a través de browser_toolset_20260801, que Haiku 4.5 no soporta. Los SDKs de Python y TypeScript añadieron clases beta para ambos el día del lanzamiento. Consulte la documentación de la herramienta de uso de computadora para ver las herramientas miembro.
Límites de velocidad
Haiku 5.5 tiene los mismos límites de velocidad que Haiku 4.5: 1,000 solicitudes, 2M tokens de entrada y 400K tokens de salida por minuto en el nivel Start, hasta 10,000 solicitudes, 10M de entrada y 2M de salida en Scale. El nivel Priority no es compatible. Para el manejo de 429, consulte la guía de límite de velocidad excedido.
Pruebe la API de Claude Haiku 5.5 en Apidog
Las solicitudes guardadas hacen que las comparaciones de esfuerzo y la depuración de rechazos sean repetibles. Aquí está la configuración en Apidog:

- Cree un entorno y añada
ANTHROPIC_API_KEYcomo una variable secreta. Refiérase a ella como{{ANTHROPIC_API_KEY}}en el encabezadox-api-key, junto aanthropic-version: 2023-06-01ycontent-type: application/json. - Cree una solicitud POST a
https://api.anthropic.com/v1/messages, pegue el cuerpo de la primera llamada y guárdela. - Añada aserciones: el estado es 200,
$.stop_reasones igual aend_turn,$.usage.output_tokenses mayor que 0, y$.content[*].typecontienetext. Un rechazo o una respuestaxhighvacía ahora fallará la prueba en lugar de pasar desapercibida. - Duplique la solicitud cuatro veces con
low,high,xhighymax, y ejecute la carpeta. Obtendrá elusagepara cada nivel de esfuerzo en su propio prompt. - Añada la variante de prompt de sistema cacheado y afirme que
$.usage.cache_read_input_tokenses mayor que 0 en la segunda ejecución.
Para patrones más amplios, vea pruebas de aplicaciones LLM.
Preguntas frecuentes
¿Cuál es el ID del modelo Claude Haiku 5.5? claude-haiku-5-5, sin sufijo de fecha y sin alias separado, en la API de Claude, Google Cloud, Microsoft Foundry y Claude Platform en AWS. En Amazon Bedrock es anthropic.claude-haiku-5-5.
¿Existe una API gratuita de Claude Haiku 5.5? No hay un nivel gratuito continuo, pero los nuevos usuarios de la API obtienen una pequeña cantidad de crédito gratuito para probar la API. Los usuarios gratuitos de Claude.ai pueden seleccionar Haiku 5.5 en el chat, pero eso no es una clave de API. Los planes Max y Team ahora incluyen créditos API mensuales. La guía de acceso gratuito cubre lo que cuenta y lo que no.
¿Por qué mi solicitud a Haiku 4.5 devuelve 400? Verifique si hay budget_tokens, un temperature o top_p no predeterminado, cualquier top_k, un prefill del asistente o la antigua herramienta computer_20250124. Esas son las causas habituales.
¿Puedo usar Haiku 5.5 en Claude Code? Sí, a partir de la v2.1.293. En la API de Anthropic, el alias haiku se resuelve a Haiku 5.5. Vea Claude Haiku 5.5 en Claude Code.
¿Debo usar Haiku 5.5 o Sonnet 5.5 para codificación agéntica? Anthropic dice que Sonnet 5.5 y Opus 5.5 "siguen siendo mejores opciones para tareas complejas de codificación agéntica". Use Haiku 5.5 para trabajos de alcance limitado: clasificación, resumen, compresión, subagentes y uso del navegador.
Próximo paso
Envíe la primera solicitud a medium, luego vuelva a ejecutarla en low y high con un prompt de su propia carga de trabajo y compare usage.output_tokens y la calidad de la respuesta. Descargue Apidog para mantener las tres ejecuciones con aserciones, de modo que el próximo lanzamiento del modelo sea un cambio de un solo campo.
