Puesto #3 Programación — IA que Escribe Software de Producción
Anthropic

Claude Sonnet 5.5

Claude Sonnet 5.5 es el modelo de programación que puedes dejar encendido todo el día: rápido, a la mitad del precio por token de Opus 5.5 y lo bastante bueno como para que la mayoría de correcciones, funciones nuevas y refactorizaciones nunca necesiten el modelo insignia. Eso sí, no subas el control de esfuerzo al máximo: en su nivel más alto escribe más que cualquier modelo que Artificial Analysis haya medido, y algunos resultados empeoran.

Actualizado 29 de septiembre de 2026 Agentic CodingTerminal-Bench 4.0 64%Claude Code
Ideal para

Claude Sonnet 5.5 es el modelo de programación que puedes dejar encendido todo el día: rápido, a la mitad del precio por token de Opus 5.5 y lo bastante bueno como para que la mayoría de correcciones, funciones nuevas y refactorizaciones nunca necesiten el modelo insignia. Eso sí, no subas el control de esfuerzo al máximo: en su nivel más alto escribe más que cualquier modelo que Artificial Analysis haya medido, y algunos resultados empeoran.

Por qué gana

Las pruebas independientes de Artificial Analysis le dan un 64 % en Terminal-Bench 4.0, algo por encima de Opus 5.5 y GPT-6 Astra (alrededor del 60 % cada uno). Anthropic informa de un 52,1 % en FrontierCode con esfuerzo xhigh y un 55,5 % en CursorBench 4.0, a unos dos puntos de Opus 5.5. Vals AI lo sitúa segundo de 66 modelos en su índice y primero en Vibe Code Bench y Code Migration. Los tokens cuestan 2/10 dólares y la respuesta llega más de un 30 % más rápido que con Sonnet 5.

Ten en cuenta

Con esfuerzo max usó unos 193.000 tokens de salida por tarea en las pruebas de Artificial Analysis, la cifra más alta que han medido, y su resultado en FrontierCode cae del 52,1 % en xhigh al 46,2 % en max. La propia Anthropic dice que Opus 5.5 sigue siendo claramente más fuerte en el trabajo complejo y abierto. Las tareas de seguridad de mayor riesgo pasan a Sonnet 5, y quienes usan la API deben afrontar cinco cambios incompatibles al migrar.

01

Lo que realmente es

Imagina a dos carpinteros. Uno es el maestro al que llamas cuando una casa necesita una escalera nueva y nadie ha dibujado todavía los planos. El otro es el profesional constante capaz de colgar cuarenta puertas en una semana, todas perfectamente a escuadra.

La mayor parte de la semana de un equipo de software son puertas, no escaleras: una prueba que falla, un formulario que necesita un campo nuevo, una API que ha cambiado de nombre. Claude Sonnet 5.5 está hecho para las puertas.

Anthropic lo lanzó el 28 de septiembre de 2026 como segundo modelo de la familia Claude 5.5, una semana después de Opus 5.5. Mantiene el precio de Sonnet 5: 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida, la mitad que Opus 5.5. Anthropic dice que funciona más de un 30 % más rápido que Sonnet 5 y cuesta hasta un 30 % menos por tarea porque termina en menos pasos.

Las cifras independientes

Para los agentes de programación, la prueba en la que más confiamos es Terminal-Bench 4.0: trabajos largos de varios pasos en una línea de comandos real, donde el modelo tiene que instalar cosas, ejecutarlas, leer los errores y volver a intentarlo.

Artificial Analysis la realizó de forma independiente en septiembre de 2026. Sonnet 5.5 obtuvo un 64 %, algo por delante de Opus 5.5 y GPT-6 Astra, en torno al 60 % cada uno. La ejecución propia de Anthropic es más alta, un 70,6 %, pero los entornos de prueba de los fabricantes tienden a favorecer a sus propios modelos, así que el 64 % independiente es la cifra que conviene recordar. En cualquier caso, es un salto enorme respecto a Sonnet 5, que obtuvo un 10,3 % en la tabla de Anthropic.

Una segunda fuente independiente coincide en lo esencial. Vals AI sitúa a Sonnet 5.5 en el segundo puesto de 66 modelos en su índice, con un 69,22 %, a menos de medio punto de Opus 5.5 y con un coste por prueba de unas dos terceras partes. Es primero en dos clasificaciones de programación: Vibe Code Bench (crear pequeñas aplicaciones a partir de una descripción), con un 92,39 %, y Code Migration, con un 69,83 %.

Lo que añaden las pruebas de Anthropic

La tabla de lanzamiento de Anthropic completa los detalles:

  • FrontierCode v1.1, que pregunta si un cambio de código podría integrarse sin que nadie lo toque: 52,1 % con esfuerzo xhigh. Opus 5.5 obtiene un 54,4 % y GPT-6 Sol un 49,3 %.
  • CursorBench 4.0, construido a partir de sesiones reales en el editor Cursor: 55,5 %, unos dos puntos por detrás de Opus 5.5 y muy por delante del 34,1 % de Sonnet 5.

Lo más útil son los gráficos de coste, que enfrentan la puntuación de cada modelo con su coste por tarea en cada nivel de esfuerzo. Destacan dos hallazgos. Con esfuerzo High, el predeterminado de la API, Sonnet 5.5 iguala la mejor puntuación de GPT-6 Sol en FrontierCode por aproximadamente una quinta parte del coste por tarea. Y con esfuerzo Medium, el predeterminado en Claude Code, supera la mejor puntuación de Sonnet 5 en Terminal-Bench por menos de una décima parte del coste.

Los primeros evaluadores lo cuentan con palabras más sencillas. Lovable vio aproximadamente la mitad de comandos de shell por tarea. Slack midió alrededor de un 14 % menos de tokens de salida que con Sonnet 5. Unity, que solo da una tarea por terminada cuando el cambio funciona de verdad en ejecución, dice que la mayoría del trabajo de Sonnet 5.5 superó esa comprobación.

El control de esfuerzo, y por qué el nivel más alto sale caro

Igual que Opus 5.5, Sonnet 5.5 tiene un control de esfuerzo con cinco niveles: low, medium, high, xhigh y max. Los niveles altos permiten al modelo pensar más tiempo y revisar mejor su trabajo. Cabría esperar que max fuera el mejor. Con Sonnet 5.5, a menudo no lo es.

Artificial Analysis midió toda la escala en su Intelligence Index:

Esfuerzo Intelligence Index Coste por tarea
Low 36 0,41 $
Medium 41 0,59 $
High 47 1,08 $
Xhigh 52 2,74 $
Max 56 7,60 $

Pasar de xhigh a max aporta cuatro puntos más por casi el triple de coste. En max, Sonnet 5.5 escribió unos 193.000 tokens de salida por tarea. Es la cifra más alta que Artificial Analysis ha medido nunca: alrededor de un 60 % más que Opus 5.5 en max y unas siete veces lo de GPT-6 Astra.

Peor aún, más esfuerzo no siempre significa mejor código. En FrontierCode, Sonnet 5.5 obtiene un 52,1 % en xhigh pero un 46,2 % en max. Anthropic explica el motivo en una nota al pie: en max, el modelo lanzaba con más frecuencia la rutina de revisión de código de Claude Code, que reparte la revisión entre muchos agentes auxiliares. En algunos casos eso agotó el tiempo o hizo cambios de más, y FrontierCode penaliza los cambios que nadie ha pedido.

La lección es sencilla: trata xhigh como el techo. Si una tarea sigue fallando en xhigh, el mejor siguiente paso suele ser Opus 5.5, no max.

La pega honesta

Opus sigue siendo el arquitecto. Anthropic lo dice sin rodeos: en varias pruebas, Sonnet 5.5 en max se acerca a Opus 5.5, pero en las pruebas internas de Anthropic y en las de evaluadores externos, Opus 5.5 sigue siendo claramente más fuerte en el trabajo complejo y abierto que exige un criterio sostenido. Opus también conserva el liderazgo en FrontierCode y CursorBench.

La factura de Claude Code no se reducirá a la mitad. Los agentes de programación releen tu proyecto constantemente, y esas relecturas se cobran como lecturas de caché, que cuestan 0,20 dólares por millón de tokens tanto en Sonnet 5.5 como en Opus 5.5. Ahorras en la entrada y la salida nuevas, pero una sesión larga que tira mucho de caché ahorra menos de lo que sugiere el titular de «mitad de precio».

El trabajo de seguridad se desvía. Sonnet 5.5 es el primer Sonnet que llega con las salvaguardas de ciberseguridad que Anthropic aplica a sus modelos más potentes. La corrección de errores habitual no se ve afectada, pero las tareas de seguridad de mayor riesgo pasan visiblemente a Sonnet 5, salvo que tu equipo esté aprobado a través del Cyber Verification Program de Anthropic.

Migrar exige un poco de trabajo. Anthropic enumera cinco cambios incompatibles respecto a Sonnet 5. Forzar el uso de herramientas devuelve ahora un error, los valores de temperatura no predeterminados se rechazan y el texto entre llamadas a herramientas llega en otro formato. Nada de esto es difícil de arreglar, pero no basta con cambiar una línea.

Dónde encaja

Si el trabajo es… Usa Por qué
Un error, una función o una migración bien acotados Claude Sonnet 5.5 Rápido y barato con esfuerzo medium o high
Arquitectura abierta o un problema que nadie ha acotado Claude Opus 5.5 Criterio claramente más fuerte, según Anthropic y los evaluadores
Trabajo largo en terminal sin supervisión al menor coste por tarea GPT-6 Astra Gasta una fracción de los tokens en su mejor nivel
Pulir el front-end, diapositivas, pequeños proyectos visuales Claude Sonnet 5.5 Buen ojo para el diseño e iteración rápida

El veredicto

Claude Sonnet 5.5 es el modelo que la mayoría de desarrolladores debería dejar encendido. Se encarga de las puertas, las cuarenta, rápido y a la mitad del precio por token del modelo insignia. Déjalo en medium o high, usa xhigh para los casos difíciles y, cuando el encargo resulte ser una escalera, llama a Opus.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Resultados independientes en terminal: Artificial Analysis midió un 64 % en Terminal-Bench 4.0 en septiembre de 2026, algo por encima de Opus 5.5 y GPT-6 Astra, en torno al 60 %. Es la prueba independiente que decide la mayoría de comparaciones entre agentes de programación, y Sonnet 5.5 salió bien parado a la mitad del precio por token de Opus.
  • Barato con ajustes razonables: Los gráficos de Anthropic muestran que, con esfuerzo High (el predeterminado de la API), Sonnet 5.5 iguala la mejor puntuación de GPT-6 Sol en FrontierCode por aproximadamente una quinta parte del coste por tarea. En Terminal-Bench, el esfuerzo Medium ya supera la mejor puntuación de Sonnet 5 por menos de una décima parte del coste.
  • Termina en menos pasos: Los primeros evaluadores describen el mismo patrón. Slack midió alrededor de un 14 % menos de tokens de salida que con Sonnet 5, Lovable vio aproximadamente la mitad de ejecuciones de shell por tarea y, en una prueba de Balyasny, usó unos 121.000 tokens por respuesta donde Sonnet 5 usaba 497.000.
  • Fuerte en migraciones y prototipos rápidos: Vals AI coloca a Sonnet 5.5 en primer lugar en Vibe Code Bench (92,39 %) y Code Migration (69,83 %), y segundo en el Vals Index general, con un coste por prueba de unas dos terceras partes del de Opus 5.5.
  • Buen ojo para las interfaces: Anthropic dice que Sonnet 5.5 tiene un gran sentido del diseño: sabe pulir interfaces de usuario y seguir plantillas de diapositivas con tanta precisión que apenas hace falta retocarlas. Además, la respuesta llega más de un 30 % más rápido que con Sonnet 5, lo que hace muy cómodo ir editando sobre la marcha.

Limitaciones honestas

  • El esfuerzo max es una trampa: Artificial Analysis midió unos 193.000 tokens de salida por tarea en max, alrededor de un 60 % más que Opus 5.5 en max y unas siete veces lo de GPT-6 Astra. En ese nivel desaparece casi toda la ventaja de precio frente a Opus.
  • Más esfuerzo, peores fusiones: En FrontierCode, que comprueba si los cambios podrían integrarse sin que un humano los retoque, Anthropic informa de un 52,1 % en xhigh pero un 46,2 % en max. En max, el modelo lanzaba con más frecuencia una rutina de revisión de código repartida entre muchos agentes auxiliares, que a veces agotaba el tiempo o editaba más allá de lo pedido.
  • No es el arquitecto: Anthropic afirma que Opus 5.5 sigue siendo claramente más fuerte en el trabajo complejo y abierto que exige un criterio sostenido. Opus también lidera FrontierCode (54,4 %) y CursorBench (57,8 %).
  • El trabajo de seguridad se desvía: Las tareas de ciberseguridad de mayor riesgo pasan visiblemente a Sonnet 5. La corrección de errores habitual no se ve afectada, y los equipos de seguridad verificados pueden solicitar un acceso más amplio.
  • No basta con cambiar el nombre del modelo en la API: Anthropic enumera cinco cambios incompatibles respecto a Sonnet 5, entre ellos errores al forzar el uso de herramientas y al fijar valores de temperatura distintos del predeterminado. Lee la guía de migración antes de cambiar código en producción.
03

Resumen de Benchmarks

Terminal-Bench 4.0 — 64 % independiente (70,6 % según el fabricante)

Trabajo de varios pasos en una terminal de línea de comandos. Artificial Analysis midió un 64 %, frente a alrededor del 60 % de Opus 5.5 y GPT-6 Astra (xhigh). La mejor ejecución propia de Anthropic llega al 70,6 %, frente al 66,4 % de Opus 5.5 en xhigh y el 10,3 % de Sonnet 5.

FrontierCode v1.1 — 52,1 % en xhigh, 46,2 % en max

Si los cambios de código están listos para integrarse. Tabla de Anthropic: Opus 5.5 54,4 %, GPT-6 Sol 49,3 %, Sonnet 5 42,4 %. Sonnet 5.5 puntúa menos en max que en xhigh.

CursorBench 4.0 — 55,5 %

Tareas ambiguas que abarcan varios archivos, tomadas de sesiones reales de Cursor. Anthropic da un 57,8 % a Opus 5.5 y un 34,1 % a Sonnet 5.

Vals Index — 69,22 % (2.º de 66)

Índice independiente de Vals AI, 0,47 puntos por detrás de Opus 5.5 y por delante de Fable 5.1, con 20,80 dólares por prueba frente a 32,77 dólares de Opus 5.5. Primero en Vibe Code Bench y Code Migration.

Tokens de salida por tarea — ~193.000 en max

Medición de Artificial Analysis sobre su Intelligence Index, la más alta registrada: alrededor de un 60 % más que Opus 5.5 (max) y unas siete veces GPT-6 Astra (max).

Precio — 2 / 10 dólares por millón de tokens, 0,20 dólares por lectura de caché

Igual que Sonnet 5 y la mitad de los 4/20 dólares de Opus 5.5. Las lecturas de caché cuestan los mismos 0,20 dólares que en Opus, así que las sesiones de programación que tiran mucho de caché ahorran menos de lo que sugiere el precio de catálogo. Las solicitudes por lotes tienen un 50 % de descuento.

04

El Veredicto

Claude Sonnet 5.5 es el modelo que conviene dejar funcionando para la ingeniería del día a día: errores bien acotados, funciones nuevas, migraciones y trabajo de front-end, con esfuerzo medium o high, donde es rápido y barato. Queda justo por detrás de GPT-6 Astra y Opus 5.5 porque su mejor resultado independiente en terminal llega con esfuerzo max, justo donde más tokens quema y donde cae su calidad de integración. Mantenlo por debajo de max y deja las preguntas abiertas de arquitectura a Opus 5.5.

05

Preguntas frecuentes