Claude Sonnet 5.5 Precios: Desglose Detallado de Costos (API, Caching, Lotes y Planes)

Precio de Claude Sonnet 5.5: $2/$10 por millón de tokens, $0.20 por lecturas de caché, lotes a mitad de precio. Ejemplos de costos calculados, costos de esfuerzo y precios de planes.

Ashley Goolam

Ashley Goolam

29 September 2026

Claude Sonnet 5.5 Precios: Desglose Detallado de Costos (API, Caching, Lotes y Planes)

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Claude Sonnet 5.5 cuesta $2 por millón de tokens de entrada y $10 por millón de tokens de salida en la API de Claude, lo mismo que Sonnet 5. Las lecturas de caché cuestan $0.20 por millón, la API por lotes reduce ambas tarifas a $1 y $5, la ventana de contexto completa de 1 millón se factura a la tarifa estándar y no se ofrece el modo rápido. El aumento planificado de Sonnet 5 para el 1 de septiembre a $3/$15 fue cancelado, por lo que $2/$10 es ahora el precio estándar.

Esta guía enumera cada partida de precios de Claude Sonnet 5.5, presenta tres ejemplos de costos con la aritmética mostrada y explica por qué el esfuerzo mueve su factura más que la tarifa por token. ¿Nuevo en el modelo? Comience con qué es Claude Sonnet 5.5, o lea cómo usar Claude Sonnet 5.5 gratis. Para verificar los números con su propio tráfico, envíe la solicitud desde Apidog y lea el bloque usage en cada respuesta.

Tabla de precios de la API de Claude Sonnet 5.5

Precios por millón de tokens (MTok), de la documentación de precios de Anthropic:

Partida Precio por MTok
Entrada $2.00
Escritura en caché de 5 minutos $2.50
Escritura en caché de 1 hora $4.00
Lectura de caché $0.20
Salida $10.00
Entrada por lotes $1.00
Salida por lotes $5.00

Tres detalles cambian lo que paga:

Cómo se compara Sonnet 5.5 en el precio de lista

Modelo Entrada Salida Notas
Claude Sonnet 5.5 $2 $10 Lectura de caché $0.20; contexto de 1M; sin modo rápido
Claude Sonnet 5 $2 $10 Lectura de caché $0.20; subida de $3/$15 cancelada
Claude Opus 5.5 $4 $20 Lectura de caché $0.20; modo rápido $8/$40
Claude Haiku 4.5 $1 $5 Contexto de 200k
GPT-6 Sol $2 $10 90% de descuento en entrada en caché; contexto de 872k
GPT-6 Luna $0.10 $0.50 Contexto de 1M

Sonnet 5.5 cuesta la mitad que Opus 5.5 en entrada, salida y escrituras en caché. Comparte el precio de lista exacto de $2/$10 con GPT-6 Sol, por lo que la elección entre estos dos se reduce a los resultados por tarea. Para conocer los antecedentes, consulte precios de Claude Sonnet 5, la guerra de precios de modelos de IA de septiembre de 2026 y precios de GPT-6 Sol.

Ejemplos prácticos: cuánto cuestan las solicitudes reales

La fórmula para cada partida: tokens ÷ 1,000,000 × precio por MTok. Ponga precio a cada partida, luego sume.

Ejemplo 1: una solicitud de estilo chat

3,000 tokens de entrada, 800 tokens de salida, sin caché.

Mil de estas costarían $14. La salida es el 21% de los tokens pero el 57% de la factura, por lo que la longitud de la salida importa más que la longitud del prompt.

Ejemplo 2: un agente releyendo un prefijo de 50,000 tokens

Un bucle de agente envía el mismo prefijo de 50,000 tokens (prompt del sistema, herramientas, contexto del repositorio) en 20 llamadas. Solo el prefijo tiene precio aquí.

Sin caché: 20 × 50,000 = 1,000,000 tokens; 1,000,000 ÷ 1,000,000 × $2 = $2.00

Con caché, con una escritura de 5 minutos:

Esto ahorra $1.685, aproximadamente un 84%. La escritura de 5 minutos solo vale la pena mientras las llamadas caen dentro de la ventana; para bucles más lentos, una escritura de 1 hora cuesta 50,000 ÷ 1,000,000 × $4 = $0.20, por lo que el total es $0.20 + $0.19 = $0.39, todavía un 80% por debajo de sin caché. El mismo razonamiento se aplica a Opus en nuestro cálculo de costos de caché de prompts; la tarifa de lectura de $0.20 es idéntica.

Ejemplo 3: un trabajo por lotes de 10,000 solicitudes

Misma forma que el Ejemplo 1, enviada a través de la API por lotes.

El procesamiento por lotes también eleva el límite de salida de 128K a 300K tokens con la beta output-300k-2026-03-24.

Costo por tarea, no por token

La tarjeta de tarifas le dice cuánto cuesta un token, no cuántos tokens consume su tarea. Ese segundo número varía mucho más con el esfuerzo que cualquier diferencia de tarifa entre modelos.

Anthropic afirma que, en sus pruebas, Sonnet 5.5 “cuesta hasta un 30% menos por tarea que su predecesor”. La publicación de lanzamiento también grafica el costo en cada nivel de esfuerzo. Las ejecuciones de Terminal-Bench 4.0 son propias de Anthropic, FrontierCode fue ejecutado por Cognition, y los costos del índice provienen de Artificial Analysis:

Esfuerzo Terminal-Bench 4.0 (puntuación, $/intento) FrontierCode v1.1 (puntuación, $/tarea) Índice AA (puntuación, costo de ejecución)
bajo 20.0%, $0.76 29.3%, $0.19 35.8, $544
medio 28.8%, $0.83 36.5%, $0.24 40.7, $701
alto 43.0%, $1.94 49.4%, $0.42 46.7, $1,176
muy alto 61.5%, $5.30 52.1%, $1.59 51.9, $2,738
máximo 70.6%, $12.54 46.2%, $20.78 56.0, $8,977

Lo que destaca:

La verbosidad al máximo es la otra trampa. El informe de OfficeChai sobre los datos de Artificial Analysis sitúa a Sonnet 5.5 en aproximadamente 193,000 tokens de salida por tarea de índice al máximo, con un costo por tarea un 50% superior a Sonnet 5. Simon Willison informó en Hacker News que una ejecución de máximo esfuerzo quemó 128,000 tokens de pensamiento y se agotó antes de producir la respuesta.

Seis palancas para reducir la factura

  1. Establezca el esfuerzo intencionadamente. La API por defecto usa high; Claude Code y las aplicaciones de Claude por defecto usan medium. La guía de prompting de Anthropic sugiere medium o low para el chat y xhigh o max solo para ganancias de calidad medidas. No transfiera las configuraciones de Sonnet 5; la escala fue recalibrada.
  2. Use between_tools donde antes tenía thinking desactivado. thinking: {"type": "disabled"} ahora devuelve un 400; {"type": "between_tools"} lo reemplaza en low, medium y high.
  3. Cachee todo lo que se reutilice. El prompt mínimo cacheable es de 512 tokens (1,024 en Sonnet 5). Cambiar el effort de nivel superior entre solicitudes invalida la caché, así que manténgalo constante.
  4. Procese por lotes lo que pueda esperar. Mitad de precio en entrada y salida.
  5. Mantenga max_tokens honesto. La guía de Anthropic considera stop_reason: "max_tokens" como una respuesta fallida, por lo que una respuesta truncada es un gasto sin nada que entregar.
  6. Recorte el trabajo no solicitado. Sonnet 5.5 añade pruebas, documentos y archivos que no solicitó, e inicia rondas de revisión adicionales en xhigh y max. El párrafo de prompt de sistema sugerido por Anthropic redujo el costo de la sesión en aproximadamente un tercio en max sin cambios en la calidad.

Dónde más paga por Sonnet 5.5

¿Busca créditos en su lugar? Consulte ¿hay una API gratuita de Claude Sonnet 5.5?

Rastree el costo por solicitud en Apidog

Cada respuesta de Mensajes lleva un objeto usage con input_tokens, output_tokens y recuentos de caché. Eso es suficiente para ponerle precio a cualquier llamada en Apidog:

  1. Guarde su clave como una variable de entorno ANTHROPIC_API_KEY.
  2. Guarde esta solicitud una vez por nivel de esfuerzo (low, medium, high) con el mismo prompt:
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 4000,
    "thinking": {"type": "between_tools"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Clasifique este ticket de soporte: ..."}]
  }'
  1. Agregue un post-procesador que ponga precio a la llamada y falle en caso de truncamiento:
const body = pm.response.json();
const u = body.usage;
const cost = (u.input_tokens * 2 + u.output_tokens * 10) / 1e6;
pm.environment.set("last_call_usd", cost.toFixed(5));
pm.test("no truncado", () => pm.expect(body.stop_reason).to.not.eql("max_tokens"));
  1. Ejecute los tres y compare usage.output_tokens y el costo lado a lado. Si usa caché, agregue los recuentos de caché a sus propias tarifas.

El recorrido completo de la solicitud se encuentra en cómo usar la API de Claude Sonnet 5.5.

Preguntas frecuentes

¿Cuánto cuesta Claude Sonnet 5.5 por millón de tokens? $2 de entrada y $10 de salida en la API de Claude. Las lecturas de caché cuestan $0.20; la API por lotes cobra $1 y $5.

¿Es Sonnet 5.5 más caro que Sonnet 5? No. El precio por token es idéntico, y Anthropic dice que Sonnet 5.5 cuesta hasta un 30% menos por tarea en sus pruebas.

¿Hay un recargo por encima de 200k tokens? No. La ventana completa de 1M se factura a la tarifa estándar.

¿Sonnet 5.5 tiene modo rápido? No. El modo rápido solo está disponible en Opus 5.5, Opus 5 y Opus 4.8.

¿Es Claude Sonnet 5.5 gratis? En la aplicación de chat de Claude, sí: cualquiera puede chatear con ella en el plan Gratuito. La API funciona con créditos prepagos; la guía de la API gratuita cubre los programas de créditos.

Siguiente paso: ponga precio a su propia carga de trabajo

Tome sus tres tipos de solicitudes más comunes, ejecute cada una en dos niveles de esfuerzo y multiplique los números de usage por la tabla anterior. Verá rápidamente si medium mantiene su estándar de calidad o si high justifica sus tokens adicionales. Descargue Apidog para mantener esas solicitudes y el script de costos lado a lado.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs