Claude Sonnet 5.5 cuesta $2/$10 por millón de tokens de entrada/salida, la mitad de los $4/$20 de Claude Opus 5.5. En la tabla de lanzamiento de Anthropic, se sitúa a pocos puntos de Opus 5.5 en la mayoría de las filas y lo supera en Terminal-Bench 4.0 (70.6% vs 66.4%), sin embargo, Anthropic dice que Opus 5.5 "sigue siendo claramente más fuerte en trabajos complejos y de final abierto". El veredicto: dirija el trabajo bien delimitado y de alto volumen, así como los subagentes, a Sonnet 5.5 con un esfuerzo de bajo a alto. Pague por Opus 5.5 para tareas largas y de final abierto, o donde empujaría a Sonnet a muy alto o máximo, porque Opus en nivel medio o alto a menudo obtiene mejores resultados por una cantidad de dinero similar o menor.
Para cada modelo por separado, consulte qué es Claude Sonnet 5.5 y qué es Claude Opus 5.5. La última sección muestra cómo probar ambos con sus propios prompts en Apidog.
Especificaciones y precio lado a lado
| Sonnet 5.5 | Opus 5.5 | |
|---|---|---|
| ID de modelo de API | claude-sonnet-5-5 |
claude-opus-5-5 |
| Entrada / salida, por 1M de tokens | $2 / $10 | $4 / $20 |
| Escritura de caché (5 min) | $2.50 | $5 |
| Lectura de caché | $0.20 | $0.20 |
| Modo rápido | No disponible | $8 / $40 |
| Esfuerzo predeterminado en la API | high |
medium |
| Pensamiento | Adaptativo por defecto, o between_tools |
Adaptativo, siempre activo |
| Contexto / salida máxima | 1M / 128K | 1M / 128K |
| Clase de latencia | Rápida | Moderada |
Tres filas son las más importantes:
- Las lecturas de caché cuestan lo mismo, por lo que en bucles de agentes con mucho caché, la diferencia radica principalmente en la salida y las escrituras de caché. El precio de Claude Sonnet 5.5 hace los cálculos. Ningún modelo cobra un premium por contexto largo.
- El esfuerzo predeterminado difiere. Una prueba con la configuración predeterminada enfrenta a Sonnet en
altocontra Opus enmedio, la combinación donde Opus tiende a ganar. - El modo rápido es solo para Opus (documentación). Anthropic dice que Sonnet 5.5 genera la salida un 30%+ más rápido que Sonnet 5.
Benchmarks: cercanos en la tabla de lanzamiento, más amplios en la tarjeta del sistema
Las filas de la uno a la ocho son la tabla de lanzamiento de Anthropic; el resto provienen de la tarjeta del sistema. Cognition ejecutó FrontierCode, Cursor ejecutó CursorBench, Zapier ejecutó AutomationBench y Artificial Analysis (AA) ejecutó GDPval-AA y AA-Briefcase; Anthropic ejecutó los demás. Sonnet está al máximo esfuerzo a menos que se indique lo contrario.
| Benchmark | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4% (xhigh) |
| FrontierCode 1.1 Main | 46.2% max, 52.1% xhigh | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 (Elo) | 1844 | 1846 |
| AA-Briefcase v1.1 (Elo) | 1811 | 1822 |
| HLE, con herramientas | 64.5% | 67.7% |
| OSWorld 2.1, parcial | 80.1% | 81.8% |
| Chartography, sin herramientas | 61.6% | 64.4% |
| SWE-Bench Pro | 81.3 | 89.9 |
| SWE-Bench Multimodal | 54.3 | 61.4 |
| HLE, sin herramientas | 56.9 | 64.4 |
| OSWorld 2.1, paso estricto | 43.5% | 48.7% |
| ProgramBench, contexto largo | 79.7% | 91.2% |
| Terminal-Bench-Science 0.1 | 59.9% | 58.7% |
| AutomationBench | 44.7 | 42.5 |
| HealthBench Profesional | 69.2 | 65.6 |
La tabla de lanzamiento es el corte más halagador: fuera de Terminal-Bench, Opus lidera sus filas porcentuales por 1.7 a 3.2 puntos, contando la puntuación xhigh de FrontierCode de Sonnet. Cinco filas de la tarjeta del sistema amplían la brecha a 5.2 a 11.5 puntos: SWE-Bench Pro, SWE-Bench Multimodal, HLE sin herramientas, OSWorld estricto y ProgramBench de contexto largo. El trabajo largo, sin asistencia y de tarea completa es donde Opus se mantiene a la cabeza.
Lea la victoria de Terminal-Bench 4.0 con cuidado: la sección 8.5 de la tarjeta del sistema dice que el retroceso de seguridad afectó al 10% de los intentos de Opus frente al 1.5% de los de Sonnet, y la propia ejecución de AA puntuó a Sonnet 5.5 en un 63.6%. Detalles en benchmarks de Claude Sonnet 5.5.
El esfuerzo decide la comparación
La tabla de lanzamiento compara cada modelo en su mejor configuración. Su factura no. La página de lanzamiento de Anthropic traza cada nivel de esfuerzo con el costo por intento o tarea:
| Benchmark, modelo | Bajo | Medio | Alto | Xhigh | Máximo |
|---|---|---|---|---|---|
| Terminal-Bench, Sonnet | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Terminal-Bench, Opus | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| CursorBench, Sonnet | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| CursorBench, Opus | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| FrontierCode, Sonnet | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| FrontierCode, Opus | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| AA-Briefcase, Sonnet | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| AA-Briefcase, Opus | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
Lo que muestra:
- Opus en nivel medio a menudo supera a Sonnet en nivel alto. Terminal-Bench 4.0: Opus obtiene un 57.6% por $2.94 por intento, Sonnet un 43.0% por $1.94.
- Opus por debajo del máximo puede superar lo mejor de Sonnet por menos. CursorBench: Opus en nivel alto (56.0%, $3.97) vs Sonnet en máximo (55.5%, $9.67). FrontierCode: Opus en nivel medio (54.6%, $0.80) vs lo mejor de Sonnet (52.1%, $1.59).
- Sonnet en nivel máximo puede costar más que Opus en nivel máximo: $29.19 vs $21.05 en AA-Briefcase, por una puntuación menor. En FrontierCode, la puntuación máxima de Sonnet cayó por debajo de su puntuación xhigh porque desplegó subagentes de revisión, según la nota a pie de página de Anthropic.
- Sonnet domina la parte inferior de la curva. Su configuración baja supera el punto más barato de Opus en cada gráfico.
La mitad del precio del token no es la mitad del costo por tarea: Sonnet gasta más tokens a medida que el esfuerzo aumenta. Los datos de AA, según los informó OfficeChai, sitúan a Sonnet 5.5 en aproximadamente 193,000 tokens de salida por tarea de índice al máximo, aproximadamente un 60% más que Opus 5.5.
Ese es el principal debate en el hilo de Hacker News: muchos comentaristas leen los gráficos como si dijeran que Opus con menor esfuerzo iguala o supera a Sonnet en alto o muy alto, dejando el nicho de Sonnet en esfuerzo bajo o medio y como subagente bajo un orquestador de Opus.
La guía de prompting de Anthropic dice que el esfuerzo de Sonnet 5.5 se recalibra: comience en alto (medio para codificación agéntica bien especificada) y reserve muy alto y máximo para ganancias medidas. Cambiar el esfuerzo de nivel superior entre solicitudes invalida la caché de prompts, así que configúrelo por carga de trabajo (guía de API).
Diferencias de seguridad y comportamiento
Los resultados de inyección de prompts se dividen. En el benchmark de inyección de prompts indirecta de Gray Swan, la tasa de éxito de ataque de Sonnet 5.5 es del 3.4% en 15 intentos (Sonnet 5: 6.7%): menos resistente que Opus 5.5, más que cualquier modelo no-Claude probado, más débil en el uso de la computadora con GUI (12.5%). Contra los atacantes adaptativos de Shade, Sonnet supera a Opus en codificación (3.01% vs 54.61% sin salvaguardias, 2.63% vs 11.13% con sondas activadas) y lo iguala en el uso de la computadora (0.07%); en el uso del navegador es el primer modelo que Anthropic evaluó sin ataques exitosos. Consulte Opus 5.5 e inyección de prompts.
Ambos modelos incluyen salvaguardias cibernéticas; Sonnet 5.5 es el primer Sonnet en obtenerlas. Las tareas cibernéticas de mayor riesgo señaladas retroceden a Sonnet 5, automáticamente en las aplicaciones de Anthropic y en la API solo si usted opta por ello (fallbacks: "default", beta). La tarjeta del sistema advierte de más negativas incluso en trabajos de seguridad benignos.
La tarjeta del sistema también encuentra a Sonnet 5.5 más honesto bajo presión que Opus 5.5, pero más propenso a la alucinación.
Mezclando Sonnet 5.5 y Opus 5.5 en un solo sistema
Una forma de obtener ambos: Opus planifica, Sonnet ejecuta. Tres mecanismos importan.
Los bloques de pensamiento no se cruzan. Sonnet 5.5 elimina los bloques de pensamiento de Opus 5 y Opus 5.5 (no facturados; la solicitud aún devuelve 200), y los bloques están vinculados al modelo, la conversación y la cuenta. Cambie de modelo a mitad de la conversación y el razonamiento se pierde, así que transfiera el estado a través de texto: Opus escribe el plan como un mensaje, Sonnet comienza desde él (guía de migración).
La herramienta del asesor acepta Opus 5.5 como asesor de un ejecutor de Sonnet 5.5; el consejo se devuelve cifrado como advisor_redacted_result.
Claude Code tiene opusplan: Opus en modo plan, Sonnet para la ejecución. El alias sonnet significa Sonnet 5.5 solo en la API de Anthropic (v2.1.284 o posterior), por lo que en Bedrock, Google Cloud y Foundry opusplan se ejecuta en un Sonnet más antiguo. Consulte Claude Sonnet 5.5 en Claude Code.
Dónde encaja GPT-6 Sol
GPT-6 Sol comparte el precio de lista de $2/$10 de Sonnet 5.5, con lecturas en caché de $0.20 (90% de descuento) y una ventana de contexto de 872k. La tabla de Anthropic le da a Sol cuatro celdas: FrontierCode 49.3%, GDPval-AA 1487, AA-Briefcase 1483 y Chartography 53.6% sin herramientas. Una nota al pie dice que OpenAI recientemente corrigió un error de comprensión de imágenes de Sol que las puntuaciones de AA y Surge AI aún no reflejan.
El costo por tarea cambia según el benchmark. En AA-Briefcase al máximo, Sol cuesta $2.67 por tarea frente a los $29.19 de Sonnet, puntuando 1483 frente a 1811. En FrontierCode, Sonnet en nivel alto iguala lo mejor de Sol (49.4% vs 49.3%) por $0.42 frente a $2.07. Consulte GPT-6 Sol vs Claude Opus 5.5 y qué es GPT-6 Sol.
Qué modelo para qué carga de trabajo
| Carga de trabajo | Modelo y esfuerzo |
|---|---|
| Chat de alto volumen, clasificación, extracción | Sonnet 5.5, bajo o medio |
| Corrección de errores bien definidos, cambios de tamaño de PR | Sonnet 5.5, medio o alto |
| Subagentes ejecutando un plan de Opus | Sonnet 5.5, medio o alto |
| Trabajo agéntico largo y de final abierto | Opus 5.5, medio y luego alto |
Cualquier cosa que requiera Sonnet en xhigh o max |
Opus 5.5, medio o alto |
| Razonamiento de base de código de contexto largo | Opus 5.5, medio o superior |
| Agentes que leen contenido no confiable | Cualquiera; prueba tus propios casos de inyección |
Pruebe ambos con su propio tráfico
Cada gráfico anterior provino del entorno de otra persona, no de sus prompts, herramientas o mezcla de tokens. Comience con la combinación que los datos indican:
ask() {
curl -s https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"'"$1"'","max_tokens":16000,
"output_config":{"effort":"'"$2"'"},
"messages":[{"role":"user","content":"Review this diff and list each bug as JSON: ..."}]}' \
| jq '{model, stop_reason, usage}'
}
ask claude-sonnet-5-5 high
ask claude-opus-5-5 medium
En Apidog, hágalo repetible: una solicitud a https://api.anthropic.com/v1/messages, ANTHROPIC_API_KEY como variable de entorno, y {{model}} y {{effort}} en el cuerpo. Duplíquela por cada combinación y añada un post-procesador para que cada ejecución verifique las mismas cosas:
const body = pm.response.json();
pm.test("finished cleanly", () => {
pm.expect(body.stop_reason).to.not.be.oneOf(["max_tokens", "refusal"]);
});
pm.test("stays inside the token budget", () => {
pm.expect(body.usage.output_tokens).to.be.below(8000);
});
Ejecute cada par de 10 a 20 veces y compare el uso, el tiempo de respuesta y la tasa de aprobación; los tokens multiplicados por el precio de lista es su costo real por tarea. Más información en cómo probar aplicaciones LLM.
Preguntas Frecuentes
¿Es Claude Sonnet 5.5 mejor que Opus 5.5? No en la mayoría de las filas. Opus 5.5 lidera la tabla de lanzamiento excepto en Terminal-Bench 4.0 y en un empate cercano en GDPval-AA. La comparación de la generación anterior: Claude Opus 5 vs Sonnet 5.
¿Es Sonnet 5.5 la mitad del costo de Opus 5.5? Por token, sí. Por tarea depende del esfuerzo: al máximo, Sonnet costó más en AA-Briefcase ($29.19 vs $21.05).
¿Puedo cambiar de modelo a mitad de la conversación? Sí, pero Sonnet 5.5 elimina los bloques de pensamiento de Opus 5.5, así que pase el estado como texto.
¿Sonnet 5.5 o GPT-6 Sol a $2/$10? Sonnet lidera las cuatro filas compartidas en su mejor configuración; Sol puede ser mucho más barato por tarea. Pruebe ambos.
Siguiente paso
Ejecute sus dos prompts más caros a través de Sonnet 5.5 en alto y Opus 5.5 en medio, y compare la tasa de aprobación y el costo por tarea antes de cambiar una regla de enrutamiento. Para mantener las solicitudes, aserciones y resultados en un solo proyecto, descargue Apidog.
