Claude Opus 5 Precios: Desglose Completo de Costos (2026)

Precios completos de Claude Opus 5: $5/$25 de tarifas base, caché, modo por lotes y modo rápido, el cálculo del costo por tarea, y las palancas que realmente reducen su factura.

Ashley Innocent

Ashley Innocent

25 July 2026

Claude Opus 5 Precios: Desglose Completo de Costos (2026)

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Claude Opus 5 se lanzó el 24 de julio de 2026 a $5 por millón de tokens de entrada y $25 por millón de tokens de salida. Esa es la misma tarifa que Anthropic cobraba por Opus 4.8, y exactamente la mitad de lo que cuesta Fable 5. La cobertura del lanzamiento se centró en ese titular, y es precisa hasta cierto punto.

Lo que la cobertura omitió es la parte que decide su factura: escrituras en caché, aciertos en caché, tarifas por lotes, modo rápido, el multiplicador regional y los cambios de comportamiento que silenciosamente modifican el recuento de tokens. Esta guía le proporciona la tabla de precios completa y luego calcula el costo de formas de solicitud reales para que pueda estimar un presupuesto antes de implementar. Para verificar los números con su propio tráfico, envíe las solicitudes desde Apidog y lea el bloque usage en cada respuesta.

botón

La tabla de precios completa de Claude Opus 5

Cada tarifa a continuación proviene de la documentación de precios de Anthropic y se aplica al ID de modelo claude-opus-5.

Categoría de token Precio por millón de tokens
Entrada (estándar) $5.00
Salida (estándar) $25.00
Escritura en caché de prompt, TTL de 5 minutos $6.25
Escritura en caché de prompt, TTL de 1 hora $10.00
Aciertos y actualizaciones de caché $0.50
Entrada de API por lotes $2.50
Salida de API por lotes $12.50
Entrada en modo rápido $10.00
Salida en modo rápido $50.00

Algunas cosas a tener en cuenta:

Ese último punto pone un techo duro a una única solicitud. La llamada API de Mensajes más cara posible es de 1M de tokens de entrada más el máximo de salida de 128k: $5.00 + $3.20, o $8.20. En la API por lotes, donde la salida máxima aumenta a 300k con el encabezado beta output-300k-2026-03-24, el lado de salida tiene un límite de $3.75.

El ancla: igual que 4.8, la mitad de Fable 5

Aquí es donde Opus 5 se posiciona frente a los modelos con los que probablemente lo esté comparando.

Modelo Entrada / MTok Salida / MTok
Claude Opus 5 $5.00 $25.00
Claude Opus 4.8 $5.00 $25.00
Claude Fable 5 $10.00 $50.00
Claude Sonnet 5 (introductorio, hasta el 31 de agosto de 2026) $2.00 $10.00
Claude Sonnet 5 (a partir del 1 de septiembre de 2026) $3.00 $15.00

Dos lecturas de esta tabla son importantes.

Primero, actualizar de Opus 4.8 no cuesta nada por token. La tarifa es idéntica, y lo ha sido en 4.5, 4.6, 4.7 y 4.8. El cambio de ID de modelo no afecta su economía unitaria. Lo que sí cambia es su volumen de tokens, lo cual veremos a continuación. El desglose de precios de Opus 4.8 sigue siendo válido para cualquier cosa en el ID anterior.

Segundo, Opus 5 es la mitad de Fable 5. Los números de lanzamiento de Anthropic afirman que Opus 5 se sitúa dentro del 0.5% del pico de Fable 5 en CursorBench 3.2 y lo supera en OSWorld 2.0 a aproximadamente un tercio del costo por tarea. Esas son cifras proporcionadas por el proveedor del post de lanzamiento de Opus 5, y nadie las ha reproducido de forma independiente hasta el 25 de julio de 2026. Trátelas como afirmaciones, no como resultados comprobados. La comparación de Opus 5 vs Fable 5 analiza dónde la diferencia de precio vale la pena, y la página de precios de Fable 5 tiene el detalle de nivel superior.

Ejemplo práctico 1: una única solicitud

Comencemos con la forma más simple. Una llamada de resumen con 8,000 tokens de entrada y 1,200 tokens de salida.

Con 10,000 llamadas al mes, eso son $700. La misma carga de trabajo en Fable 5 cuesta $0.140 por llamada, o $1,400 al mes. En Sonnet 5 a la tarifa introductoria cuesta $0.028 por llamada, o $280.

Tenga en cuenta que la salida representa el 43% de la factura en una solicitud con casi siete veces más entrada que salida. La salida cuesta cinco veces lo que cuesta la entrada, por lo que el volumen de salida domina más rápido de lo que la mayoría de la gente espera. Eso importa más en Opus 5 que en 4.8, porque los tokens de pensamiento se facturan como salida y el pensamiento adaptativo ahora está activado por defecto.

Ejemplo práctico 2: una sesión de agente larga con caché

Aquí es donde está el verdadero dinero y los verdaderos ahorros. Tomemos un agente de codificación con un prompt de sistema de 120,000 tokens más contexto de repositorio, ejecutando una sesión de 40 turnos. Cada turno añade 1,500 tokens de nueva conversación y produce 2,500 tokens de salida.

Sin caché de prompt, se reenvía el contexto completo en cada turno:

Partida Tokens Tarifa Costo
Entrada (120,000 x 40, más 60,000 nuevos) 4,860,000 $5.00 $24.30
Salida (2,500 x 40) 100,000 $25.00 $2.50
Total $26.80

Con una caché de prompt de 5 minutos en el prefijo de 120,000 tokens:

Partida Tokens Tarifa Costo
Escritura en caché, una vez 120,000 $6.25 $0.75
Lecturas de caché (39 turnos) 4,680,000 $0.50 $2.34
Nueva entrada (1,500 x 40) 60,000 $5.00 $0.30
Salida (2,500 x 40) 100,000 $25.00 $2.50
Total $5.89

Eso es una reducción del 78%, y la salida ahora representa el 42% de la factura en lugar del 9%. Una vez que se almacena en caché correctamente, la salida es lo siguiente que se optimiza.

Una advertencia sobre el TTL de 5 minutos: las lecturas de caché lo actualizan, por lo que una sesión con turnos con menos de cinco minutos de diferencia se mantiene activa con una sola escritura. Si su agente está inactivo por más tiempo, use la escritura de 1 hora a $10 por millón. Aquí eso eleva la escritura de $0.75 a $1.20 y el total a $6.34, todavía un 76% por debajo de la ejecución sin caché.

Ejemplo práctico 3: procesamiento por lotes

Para cualquier cosa que no necesite una respuesta síncrona, la API por lotes tiene un 50% de descuento fijo. Tome 50,000 documentos con 1,200 tokens de entrada y 150 tokens de salida cada uno.

Ruta Costo de entrada Costo de salida Total
Estándar 60 MTok x $5.00 = $300.00 7.5 MTok x $25.00 = $187.50 $487.50
Por lotes 60 MTok x $2.50 = $150.00 7.5 MTok x $12.50 = $93.75 $243.75

Mismos tokens, mismo modelo, $243.75 ahorrados. La compensación es la latencia, no la calidad. Si su trabajo de clasificación, enriquecimiento o evaluación tolera la entrega asíncrona, ejecutarlo en el endpoint estándar deja la mitad del presupuesto sin utilizar.

Ejemplo práctico 4: lo que realmente cuesta el modo rápido

El modo rápido duplica la tarifa a $10 / $50 para una velocidad de salida aproximadamente 2.5 veces mayor. Ejecute la solicitud del ejemplo 1 a través de él y obtendrá $0.080 de entrada más $0.060 de salida, o $0.140 por llamada, exactamente el doble.

Eso valora a Opus 5 idénticamente a la tarifa estándar de Fable 5: está pagando precios de nivel de frontera por latencia, no por capacidad. Vale la pena para interfaces interactivas donde un usuario ve aparecer los tokens, difícil de justificar para trabajo en segundo plano. No se combina con la API por lotes, por lo que las dos palancas de costo son mutuamente excluyentes por diseño.

Las cuatro palancas que realmente mueven su factura

Estas cuatro son específicas de Opus 5 y específicas de cuánto ahorran.

1. El mínimo de la caché de prompts se redujo a 512 tokens

En Opus 4.8 el mínimo almacenable en caché era de 1,024 tokens. En Opus 5 es de 512. Los prompts que antes eran demasiado cortos para cachearse ahora lo hacen sin cambios de código más allá de añadir el bloque de control de caché.

Las matemáticas del punto de equilibrio son mejores de lo que la mayoría de la gente supone. Una escritura en caché cuesta 1.25 veces la entrada estándar, una lectura cuesta 0.1 veces. Resolviendo para el punto en que la caché gana:

Concretamente, un prompt de sistema de 700 tokens reutilizado en 1,000 llamadas en una ráfaga cuesta $3.50 sin caché. Cacheado, cuesta $0.0044 por la escritura más 999 lecturas a $0.00035, o un total de $0.354. Ese prompt no podía ser cacheado en absoluto en Opus 4.8.

2. Procesamiento por lotes al 50%

Cubierto anteriormente, pero vale la pena reiterarlo como una palanca: audite qué cargas de trabajo realmente necesitan una respuesta síncrona. Las ejecuciones de evaluación, las retroalimentaciones, los resúmenes nocturnos y la clasificación de contenido generalmente no lo necesitan.

3. Los niveles de esfuerzo low y medium son finalmente utilizables

output_config.effort controla cuánto "piensa" el modelo, y los tokens de pensamiento se facturan como salida a $25 por millón. Opus 5 recalibró los niveles de esfuerzo, y Anthropic afirma que low y medium son significativamente más fuertes que en modelos Opus anteriores. El valor predeterminado es high; xhigh sigue siendo el inicio recomendado para la codificación y el trabajo de agente.

Los ahorros escalan directamente con el volumen de tokens de pensamiento. Si una tarea promedia 8,000 tokens de pensamiento en xhigh y 1,500 en low, usted ahorra 6,500 tokens de salida, o $0.1625 por tarea, lo que equivale a $16,250 en 100,000 tareas. Esas cifras son ilustrativas: la delta real depende de sus prompts, por lo que Anthropic le indica que realice un nuevo barrido de esfuerzo contra sus propias evaluaciones en lugar de trasladar la configuración de 4.8. La guía del parámetro de esfuerzo cubre ese barrido.

Una trampa: reducir el esfuerzo recorta los tokens de pensamiento, no la longitud visible de la respuesta. Las respuestas predeterminadas y los entregables escritos de Opus 5 son más largos que los de Opus 4.8, y el esfuerzo no solucionará eso. Si desea respuestas más cortas, pida respuestas más cortas.

4. Menor sobrecarga del prompt del sistema para el uso de herramientas

Cuando envía definiciones de herramientas, la API inyecta un prompt del sistema por el que paga. En Opus 5, esa sobrecarga es de 286 tokens para la elección de herramientas auto o none, por debajo de 290 en Opus 4.8 y 675 en Opus 4.7.

Sea sincero sobre el tamaño de esto. Frente a 4.8, la diferencia de cuatro tokens es de $20 en un millón de solicitudes: ruido. Frente a 4.7, la diferencia de 389 tokens es de $0.001945 por solicitud, o $1,945 por millón de solicitudes. Si todavía está en 4.7, es dinero real; en 4.8, es un error de redondeo.

Para palancas que se aplican a toda la línea Claude, nuestra guía sobre cómo reducir su factura de la API de Claude abarca un tema más amplio.

Dos partidas que la gente pasa por alto

El multiplicador inference_geo: "us" es de 1.1x. Fije la inferencia a la infraestructura solo en EE. UU. por cumplimiento o residencia de datos y cada categoría de tokens se multiplicará por 1.1: entrada $5.50, salida $27.50, aciertos de caché $0.55, lotes $2.75 / $13.75. La carga de trabajo del ejemplo 1 pasa de $700 al mes a $770. En una factura de $50,000, es una partida de $5,000, así que confirme que necesita la fijación antes de configurarla.

Priority Tier no es compatible con Opus 5. Opus 4.8 lo mantiene. Si su planificación de capacidad depende de los compromisos de Priority Tier, eso es una restricción real para cambiar. La guía de migración de Opus 4.8 a Opus 5 lo cubre junto con los cambios de API disruptivos.

Cambios de comportamiento que aparecen en su factura

Las tarifas por token son la mitad de una factura. El volumen de tokens es la otra mitad, y tres cambios de comportamiento de Opus 5 aumentan el volumen si no hace nada.

  1. El pensamiento está activado por defecto. En Opus 4.8, una solicitud sin el campo thinking se ejecutaba sin pensamiento. En Opus 5, la misma solicitud ejecuta pensamiento adaptativo, y esos tokens se facturan como salida. Debido a que max_tokens limita el pensamiento y la respuesta juntos, algunas de esas cargas de trabajo también comenzarán a truncarse.
  2. Opus 5 delega a subagentes con mayor facilidad. Cada subagente es su propio conjunto de tokens facturados. Limite o restrinja la delegación en cargas de trabajo sensibles al costo.
  3. Opus 5 verifica su propio trabajo sin ser solicitado. Si usted mantuvo las instrucciones de "doble verificación de su trabajo", la guía de prompts de Anthropic dice que las elimine. La sobre-verificación son tokens.

Ninguno de estos cambia el precio por token. Todos ellos cambian lo que paga.

Confirmando su gasto real con Apidog

La forma más rápida de dejar de adivinar es leer el objeto usage en cada respuesta. Informa input_tokens, output_tokens, cache_creation_input_tokens y cache_read_input_tokens por separado, que es el desglose exacto que necesita para verificar los cálculos anteriores con su propio tráfico.

Apidog es una plataforma de desarrollo y prueba de API, por lo que lo maneja bien. Dirija una solicitud al endpoint de Mensajes con "model": "claude-opus-5", luego:

  1. Duplique la solicitud guardada una vez por cada nivel de esfuerzo y compare el volumen de tokens de pensamiento lado a lado en prompts idénticos.
  2. Asegúrese de que usage.cache_read_input_tokens sea mayor que cero, de modo que una caché silenciosamente rota aparezca como una prueba fallida en lugar de una factura sorpresa.
  3. Almacene las claves como variables de entorno en lugar de en el cuerpo de la solicitud, para que una clave de desarrollo nunca ejecute un lote del tamaño de producción.
  4. Vea el flujo SSE para ver a dónde van los tokens de salida en las generaciones largas.

Descargue Apidog para ejecutar estas comprobaciones junto con el tutorial en nuestra guía de la API de Opus 5.

Lo que realmente está comprando por $5 / $25

Opus 5 es una fuerte posición en relación precio-capacidad, y no es la cima de la pila de Claude. Fable 5 sigue siendo el modelo más capaz de Anthropic ampliamente lanzado, y Opus 5 todavía está por detrás de Mythos 5 en explotación de ciberseguridad e investigación autónoma de biología. Anthropic lo afirma claramente. La honesta contextualización es capacidad de clase fronteriza a la mitad del precio fronterizo, con un techo nombrado por encima. Nuestro explicador de clase Mythos cubre lo que se sitúa por encima de esa línea.

Para la mayoría de los equipos, la verdadera pregunta no es Opus 5 versus el tope. Es si la carga de trabajo necesita Opus en absoluto, o si Sonnet 5 a $2 / $10 (que subirá a $3 / $15 el 1 de septiembre de 2026) hace el trabajo por el 40% del precio. Ejecute ambos contra sus propias evaluaciones antes de comprometer un presupuesto. Las especificaciones completas y la disponibilidad se encuentran en nuestra visión general de Claude Opus 5; la visión general de modelos de Anthropic tiene la tabla canónica.

Preguntas Frecuentes

¿Cuánto cuesta Claude Opus 5? $5 por millón de tokens de entrada y $25 por millón de tokens de salida en la API estándar. Los aciertos de caché cuestan $0.50, las ejecuciones por lotes a $2.50 / $12.50, y el modo rápido a $10 / $50.

¿Es Claude Opus 5 más caro que Opus 4.8? Por token, no: las tarifas son idénticas. Su factura aún puede aumentar, porque el "pensamiento" está activado por defecto y las respuestas predeterminadas son más largas. Mida el volumen de tokens en lugar de asumir la paridad.

¿Hay un recargo por contexto largo en la ventana de 1M? No. La ventana de contexto de 1M de tokens es tanto la predeterminada como la máxima, y no hay un nivel premium para entradas largas.

¿Cuál es la forma más económica de ejecutar Claude Opus 5? Almacene en caché de forma agresiva (el mínimo de 512 tokens significa que casi cualquier prefijo reutilizado califica), ejecute trabajos no urgentes a través de la API por lotes para obtener un 50% de descuento fijo, y explore los niveles de esfuerzo para encontrar el más bajo que pase sus evaluaciones. La guía de ruta gratuita y más económica tiene más información.

¿El anclaje regional tiene un costo adicional? Sí. Establecer inference_geo: "us" aplica un multiplicador de 1.1x a cada categoría de tokens, incluidos los aciertos de caché y los lotes.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs