Parámetro de Esfuerzo de Claude Opus 5: Compensación entre Costo y Capacidad

El parámetro de esfuerzo de Claude Opus 5 explicado: los cinco niveles, por qué por defecto es alto, qué cambió la recalibración, la interacción de max_tokens y el error 400 con el pensamiento deshabilitado.

INEZA Felin-Michel

INEZA Felin-Michel

25 July 2026

Parámetro de Esfuerzo de Claude Opus 5: Compensación entre Costo y Capacidad

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Cada artículo principal sobre el lanzamiento de Claude Opus 5 el 24 de julio de 2026 mencionó la misma característica. Fortune la llamó una forma de alternar entre costo y capacidad. CNBC, Bloomberg y TechCrunch la señalaron. Ninguno de ellos dijo qué es, cuáles son los niveles, qué sucede cuando cambias uno o qué efecto tiene en tu factura.

Es un parámetro de solicitud llamado effort, tiene cinco niveles en Opus 5 y su valor predeterminado es high. Esa es toda la característica. Lo que lo hace digno de un artículo es que Anthropic recalibró los niveles para este modelo, lo que significa que la configuración que ajustaste en Opus 4.8 ahora es incorrecta, y una combinación específica de configuraciones devuelve un error 400 que aparecerá en muchos registros de migración esta semana.

💡
Si quieres probar los niveles contra un endpoint real mientras lees, Apidog es una forma sencilla de enviar la misma solicitud con cinco configuraciones diferentes y comparar los resultados.
botón

Qué es realmente el parámetro effort

El parámetro effort se encuentra en el objeto output_config de una solicitud a la API de Mensajes:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "output_config": { "effort": "high" },
  "messages": [
    { "role": "user", "content": "Refactorizar este módulo y explicar las ventajas y desventajas." }
  ]
}

Controla cuánto razonamiento interno realiza el modelo antes de responder. Opus 5 ejecuta el pensamiento adaptativo activado por defecto, y effort es el selector que establece con qué generosidad se gasta ese presupuesto de pensamiento. Un effort más alto significa más tokens de razonamiento, más costo y más latencia. Un effort más bajo significa menos de los tres.

Las interfaces de usuario exponen la misma idea como un selector de esfuerzo en lugar de un campo JSON puro, de donde proviene la descripción de la prensa como un "alternador de costo-capacidad". Debajo de esto está este parámetro. Si desarrollas con la API, el parámetro es lo que realmente controlas, por lo que de eso trata el resto de este artículo. La forma completa de la solicitud se encuentra en nuestra guía detallada de la API de Opus 5, y la referencia del parámetro se encuentra en la descripción general de modelos de Anthropic.

Algo que effort no es: un control de verbosidad. La guía de prompting de Anthropic para Opus 5 es explícita al afirmar que reducir el effort disminuye el razonamiento, no la longitud de la respuesta visible. Opus 5 ya escribe respuestas predeterminadas y resultados más largos que Opus 4.8. Si deseas una salida más corta, solicítala explícitamente en el prompt. Bajar a low no lo hará por ti.

Los cinco niveles

Nivel Qué hace Uso típico
low Razonamiento mínimo antes de responder Clasificación de alto volumen, extracción, enrutamiento, resúmenes cortos
medium Razonamiento moderado Preguntas y respuestas sobre contexto recuperado, ediciones de un solo archivo, transformaciones estructuradas
high Por defecto. Razonamiento sustancial Trabajo de propósito general cuando aún no has medido nada
xhigh Razonamiento extendido Codificación y bucles agénticos. Punto de partida recomendado por Anthropic para ambos
max Presupuesto máximo de razonamiento Problemas difíciles de un solo intento donde una respuesta incorrecta cuesta más que los tokens

Hay dos cosas de esta tabla que son fáciles de pasar por alto.

El valor predeterminado es high, no low ni xhigh. Si envías una solicitud sin output_config, obtendrás high. Esto es importante para la previsión de costos: una solicitud sin modificar en Opus 5 está realizando un trabajo de razonamiento real y se te facturará por ello, mientras que la misma solicitud sin modificar en Opus 4.8 no realizaba ningún pensamiento. Ese cambio es uno de los dos cambios importantes en la migración de Opus 4.8 a Opus 5, y es el que más probablemente sorprenda a un equipo de finanzas.

Y xhigh es la recomendación para trabajos de codificación y agénticos, no max. Anthropic posiciona xhigh como el punto de partida para esas cargas de trabajo. max existe por encima, pero empezar ahí significa pagar por un margen del que probablemente no puedas medir un beneficio. Empieza en xhigh y luego baja.

Qué cambió la recalibración

Aquí está la parte que hace que transferir configuraciones entre modelos sea una mala idea.

Anthropic recalibró lo que significa cada nivel de effort en Opus 5. La etiqueta medium en Opus 5 no describe la misma cantidad de razonamiento que medium describía en Opus 4.8. La guía de Anthropic es realizar una nueva revisión de effort en Opus 5 en lugar de portar tu configuración de 4.8.

La consecuencia práctica es más interesante que la advertencia. En modelos Opus anteriores, low y medium eran en su mayoría teóricos para trabajos serios: eran baratos, y también eran notablemente peores, por lo que los equipos configuraban todo en high o superior y pagaban por ello. En Opus 5, los niveles más bajos son significativamente más fuertes de lo que eran, lo que es la primera vez que low y medium son genuinamente utilizables en un modelo de nivel Opus para tareas de producción.

Esa es la verdadera palanca de costos en el lanzamiento, y es la que la cobertura de prensa comprimió en la palabra "alternador". Opus 5 cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida, lo mismo que Opus 4.8. Los tokens de razonamiento se cargan en el lado de salida de esa factura. Así que la diferencia entre ejecutar un pipeline de clasificación en high y ejecutarlo en low no es un error de redondeo, es una gran fracción de tu gasto de salida en una carga de trabajo donde el razonamiento extra nunca te estaba dando precisión en primer lugar. Nuestro desglose de precios de Opus 5 tiene la tarifa completa, incluido el descuento por lote del 50% y el mínimo de caché de 512 tokens, ambos de los cuales se combinan con una configuración de effort más baja.

Si buscas ahorrar en todo un conjunto de servicios de Claude en lugar de un solo endpoint, las palancas para reducir tu factura de la API de Claude también se aplican aquí, con effort ahora añadido a la lista.

La interacción de xhigh y max con max_tokens

max_tokens limita la suma de los tokens de pensamiento y los tokens de respuesta. Es un límite estricto en todo el lado de salida de la solicitud, no solo en el texto visible.

Aumenta el effort y aumentarás la cantidad de ese límite que el modelo dedica al razonamiento antes de empezar a escribir. Si elevas el effort a xhigh o max mientras dejas max_tokens en un valor que dimensionaste para un modelo que no estaba pensando, el modelo puede agotar el presupuesto en razonamiento y truncar antes de terminar la respuesta. Obtendrás una respuesta cortada sin nada obviamente incorrecto en la solicitud.

La solución es darle espacio. La guía de Anthropic es comenzar con max_tokens: 64000 cuando ejecutas xhigh o max en Opus 5:

{
  "model": "claude-opus-5",
  "max_tokens": 64000,
  "output_config": { "effort": "xhigh" },
  "messages": [
    { "role": "user", "content": "Corregir la prueba de integración fallida y explicar la causa raíz." }
  ]
}

Un max_tokens alto es un límite, no una compra. Se te factura por los tokens realmente producidos, por lo que establecer 64000 no significa pagar por 64000. Significa que el modelo no se ve obligado a detenerse a mitad de un pensamiento.

El error 400 que nadie ha documentado todavía

Este generará tickets de soporte.

Desactivar el pensamiento y solicitar un effort alto son instrucciones contradictorias, y Opus 5 rechaza la combinación directamente. Enviar thinking: {type: "disabled"} junto con effort xhigh o max devuelve un 400, aplicado por solicitud:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "thinking": { "type": "disabled" },
  "output_config": { "effort": "xhigh" }
}

Esa solicitud falla. Desactivar el pensamiento te limita a un effort high. Así que las combinaciones válidas son:

La ruta de migración que produce este error es predecible: un equipo arrastra thinking: {type: "disabled"} de una configuración de Opus 4.8 donde era inofensivo, y luego, por separado, eleva el effort a xhigh porque esa es la recomendación para la codificación. Ambas ediciones parecen razonables de forma aislada. Juntas, devuelven un 400.

El propio consejo de Anthropic es no desactivar el pensamiento en Opus 5 en absoluto. Con el pensamiento desactivado, ocasionalmente aparecen dos modos de fallo: el modelo escribe llamadas a herramientas como texto plano que nunca se ejecutan, y las etiquetas XML internas se filtran en la salida visible. En un bucle agéntico, el texto filtrado contamina las siguientes interacciones. La forma recomendada de controlar el costo en Opus 5 es un nivel de effort más bajo, no el pensamiento desactivado. Profundizamos en ambos artefactos en la guía de prompting de Opus 5.

Cómo ejecutar una evaluación de effort en tus propias pruebas

Anthropic te dice que vuelvas a evaluar. Aquí tienes un procedimiento que se puede realizar en una tarde.

1. Congela un conjunto de tareas. Extrae entre 30 y 50 prompts reales de los registros de producción, no ejemplos sintéticos. Incluye los casos difíciles que realmente te preocupan. Las diferencias de effort desaparecen en tareas fáciles, por lo que un conjunto de muestras limpio no te dirá nada.

2. Anota el criterio de aprobación antes de ver cualquier salida. Pruebas en verde, JSON valida contra un esquema, el campo extraído coincide con la verdad fundamental, un evaluador humano dice sí o no. Si tu criterio es una sensación, tu evaluación producirá una sensación.

3. Ejecuta cada prompt en cada nivel. Cinco niveles por 40 prompts son 200 llamadas. En Opus 5 eso es lo suficientemente barato como para no pensarlo, y puedes enviarlo a través de la API por lotes a mitad de precio ya que nada es sensible a la latencia.

4. Captura tres números por ejecución, no uno: aprobado o fallido, usage.output_tokens y latencia de reloj de pared. El bloque usage en la respuesta es donde reside la señal de costo real, porque cuenta los tokens de razonamiento que de otro modo estarías adivinando.

5. Elige el nivel más barato que cumpla tus requisitos, luego confírmalo en un conjunto de validación que no utilizaste para ajustar. Los equipos que omiten el conjunto de validación tienden a enviar una configuración ajustada a 40 prompts específicos.

6. Vuelve a ejecutarlo en el siguiente modelo. La razón principal por la que existe esta evaluación es que los niveles fueron recalibrados entre 4.8 y 5. Asume que volverá a ocurrir.

Comparando niveles lado a lado en Apidog

La parte mecánica de una evaluación es enviar un cuerpo de solicitud cinco veces con un campo cambiado y alinear los resultados. Eso es una cantidad considerable de copiar y pegar con curl, y es la parte que Apidog simplifica.

Una configuración que funciona:

  1. Crea una solicitud contra el endpoint de Mensajes de Anthropic y guarda tu clave como una variable de entorno en lugar de pegarla en el cuerpo. Las claves deben mantenerse fuera de cualquier cosa que compartas con el equipo.
  2. Guarda la solicitud de trabajo en una colección, luego duplícala cinco veces y cambia solo output_config.effort en cada copia.
  3. Inspecciona el objeto usage en cada respuesta para que puedas ver directamente los tokens de salida por nivel, además de cache_read_input_tokens cuando estés verificando si tu caché está funcionando.
  4. Activa el streaming y lee los eventos SSE si quieres observar cómo varía la latencia entre xhigh y low.
  5. Añade una aserción de que stop_reason está presente y no es max_tokens, para que una respuesta xhigh truncada falle ruidosamente en tu colección en lugar de parecer una respuesta corta.

Esa última aserción es la que vale la pena configurar primero, porque un truncamiento con effort alto es lo más probable que salga mal. Descarga Apidog si quieres construir la colección de comparación mientras lees. Nada de esto lo requiere; simplemente es mejor que mantener cinco scripts de shell.

El techo honesto

effort hace que Opus 5 sea más barato de ejecutar correctamente. No convierte a Opus 5 en la cima de la pila de Claude.

Los propios números de lanzamiento de Anthropic para Opus 5 son sólidos: más del doble de la puntuación de Frontier-Bench v0.1 de Opus 4.8, aproximadamente 3 veces el siguiente mejor modelo en ARC-AGI 3, y dentro del 0.5% de Fable 5 en CursorBench 3.2 a la mitad del precio. Todas estas son cifras proporcionadas por el proveedor, publicadas por Anthropic, y ninguna ha sido reproducida independientemente hasta el 25 de julio de 2026. Trátalas como afirmaciones con una fuente, no como mediciones neutrales, y consulta nuestro desglose de benchmarks de Opus 5 para conocer las advertencias sobre cada una.

Por encima de Opus 5, Fable 5 sigue siendo el modelo más capaz de Anthropic ampliamente lanzado, a $10 por millón de tokens de entrada y $50 por millón de tokens de salida. Y Opus 5 todavía está por detrás de Mythos 5 en explotación de ciberseguridad e investigación de biología autónoma, lo que Anthropic declara directamente. Ejecutar Opus 5 en max no cierra ninguna de esas brechas. El resumen honesto es capacidad de clase fronteriza a la mitad del precio fronterizo, con un techo nombrado por encima. Si la diferencia de precio vale la pena para tu carga de trabajo es la pregunta que abordamos en Opus 5 vs Fable 5.

botón

Preguntas frecuentes

¿Cuál es el nivel de effort predeterminado en Claude Opus 5? high. Una solicitud sin el campo output_config se ejecuta con un effort high y el pensamiento adaptativo activado.

¿Cuáles son los cinco niveles de effort? low, medium, high, xhigh y max. Anthropic recomienda empezar en xhigh para trabajos de codificación y agénticos, y bajar desde ahí según tus propias evaluaciones.

¿Por qué mi solicitud devuelve un 400 cuando establezco el effort en xhigh? Casi con certeza porque también enviaste thinking: {type: "disabled"}. Desactivar el pensamiento limita el effort a high, y la combinación es rechazada por solicitud. O eliminas el bloque de pensamiento deshabilitado o bajas el effort a high o menos.

¿Puedo reutilizar mi configuración de effort de Opus 4.8 en Opus 5? No. Los niveles fueron recalibrados, por lo que la misma etiqueta significa una cantidad diferente de razonamiento. Anthropic te pide que realices una nueva evaluación. La lista completa de lo que cambió se encuentra en la guía de migración.

¿Disminuir el effort hace que las respuestas sean más cortas? No. effort controla el razonamiento, no la longitud visible, y las respuestas predeterminadas de Opus 5 son más largas que las de Opus 4.8. Solicita concisión explícitamente si deseas una salida más corta.

¿Qué max_tokens debo usar en xhigh o max? Empieza en 64000. max_tokens limita el pensamiento y la respuesta juntos, por lo que un presupuesto dimensionado para un modelo que no piensa se truncará. Solo se te factura por los tokens producidos, por lo que el límite alto no cuesta nada por sí solo.

Para la hoja de especificaciones completa, la matriz de disponibilidad y el contexto de precios sobre todo esto, comienza con qué es Claude Opus 5.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs