Puesto #2 Programación — IA que Escribe Software de Producción
Anthropic

Claude Opus 5.5

Claude Opus 5.5 es el modelo de programación al que llamar cuando el trabajo es grande y enrevesado: una migración de cientos de miles de líneas, un error que atraviesa cinco servicios, un sistema heredado que ya nadie entiende del todo. En las pruebas de Anthropic supera a GPT-6 Astra; en las pruebas independientes, ambos empatan. Si ocupa nuestro segundo puesto y no el primero es solo porque Astra termina el mismo trabajo de terminal con muchos menos tokens.

Actualizado 27 de septiembre de 2026 Agentic CodingTerminal-Bench 4.0FrontierCode 54.4%
Ideal para

Claude Opus 5.5 es el modelo de programación al que llamar cuando el trabajo es grande y enrevesado: una migración de cientos de miles de líneas, un error que atraviesa cinco servicios, un sistema heredado que ya nadie entiende del todo. En las pruebas de Anthropic supera a GPT-6 Astra; en las pruebas independientes, ambos empatan. Si ocupa nuestro segundo puesto y no el primero es solo porque Astra termina el mismo trabajo de terminal con muchos menos tokens.

Por qué gana

Anthropic informa de un 66,4 % en Terminal-Bench 4.0, un 54,4 % en FrontierCode v1.1 y un 57,8 % en CursorBench 4.0, por delante de GPT-6 Astra en los dos primeros. Las pruebas independientes de Artificial Analysis dejan a Opus 5.5 y a Astra empatados en Terminal-Bench 4.0 con un 59,6 %. Los primeros probadores hablan de una migración de 680.000 líneas en menos de un día y de una auditoría de 200.000 líneas en menos de tres horas. Los tokens cuestan $4/$20 y la lectura desde caché, $0,20.

Ten en cuenta

Con esfuerzo máximo, Opus 5.5 es muy locuaz: Artificial Analysis midió unas cuatro veces más tokens de salida por tarea que GPT-6 Astra, y por eso Astra conserva nuestro primer puesto en coste por tarea terminada. Las salvaguardas de Anthropic derivan la mayor parte del trabajo de ciberseguridad a Opus 4.8, y las sesiones intensas todavía pueden chocar con los límites de uso del plan.

01

Lo que realmente es

Hay una diferencia entre alguien que escribe código y alguien que entiende un sistema.

La primera persona ve un error que dice undefined is not a function, envuelve esa línea en una comprobación if y sigue adelante. El fallo desaparece. Tres días después se rompe otra cosa, en un sitio que nadie esperaba.

La segunda persona se pregunta por qué el valor era indefinido. Lo sigue hacia atrás a través de los servicios, descubre que una escritura en la base de datos terminaba antes de que se confirmara un mensaje, y corrige el orden para que ese estado erróneo no pueda darse nunca.

Claude Opus 5.5 pertenece claramente al segundo grupo. Lanzado el 22 de septiembre de 2026, ocupa el segundo puesto de nuestra clasificación de programación, más cerca del primero que cualquier modelo anterior.

En qué destaca: trabajos grandes y enrevesados

Las historias de los primeros probadores de Anthropic tienen todas la misma forma: trabajos enormes que antes le llevaban semanas a un equipo.

  • Un probador terminó una migración de código de 680.000 líneas en menos de un día.
  • Otro auditó y corrigió una base de código de 200.000 líneas en menos de tres horas. Opus 5 necesitó más de 20 horas y 2,5 veces más tokens para el mismo trabajo.
  • En una prueba interna, Opus 5.5 y Fable 5.1 reescribieron de C a Rust HAProxy, el popular software que reparte el tráfico web entre servidores, y ambos superaron casi todas las pruebas del propio HAProxy. Opus 5.5 terminó en 9,5 horas en lugar de 12, con un coste un 51 % menor.

Son anécdotas del fabricante, no mediciones independientes, así que tómalas como una señal de la dirección, no como una garantía. Pero el patrón es coherente: cuanto más grande y desordenado el trabajo, más se distancia Opus 5.5.

Además, se explica con claridad. El anuncio de Anthropic lo muestra diagnosticando un error de facturación. En lugar de un muro de detalles técnicos, empieza por el dinero: $1,50 de la caída de ingresos de un cliente se debía a un cambio de precios, y los otros $9,92, a un error en un commit concreto que dejaba de contar el uso del último día de cada mes. Cuando un agente toca tu código, informes así son los que lo mantienen honesto.

Las pruebas: un empate, según quién lleve la cuenta

Aquí conviene ir despacio, porque las tablas del fabricante y las pruebas independientes cuentan historias ligeramente distintas.

Las cifras de Anthropic (septiembre de 2026):

  • Terminal-Bench 4.0, que mide trabajo de varios pasos en una terminal de línea de comandos: Opus 5.5 obtuvo un 66,4 % (±2,6 puntos). GPT-6 Astra obtuvo un 57,9 %, cifra comunicada por OpenAI.
  • FrontierCode v1.1, que comprueba si los cambios de código son lo bastante buenos para integrarse: Opus 5.5 54,4 %, Astra 53,3 %.
  • CursorBench 4.0, con tareas de programación más largas dentro del editor Cursor: Opus 5.5 57,8 %, Fable 5.1 51,8 %.

Las cifras independientes: Artificial Analysis ejecutó Terminal-Bench 4.0 por su cuenta y obtuvo un 59,6 % tanto para Opus 5.5 como para Astra. Empate absoluto.

Nuestra norma es confiar más en las mediciones independientes que en las tablas del fabricante. Eso nos deja un empate en capacidad pura. Así que la clasificación depende de otra cosa.

Por qué GPT-6 Astra conserva el primer puesto

Cuando dos modelos son igual de buenos, los ordenamos por lo que te cuesta una tarea terminada.

Aquí Astra tiene una ventaja clara. Con esfuerzo máximo, Artificial Analysis midió que Opus 5.5 escribía unos 119.000 tokens de salida por tarea, frente a unos 27.000 de Astra. Los tokens de Opus son más baratos ($20 por millón de salida frente a los $50 de Astra), pero usa unas cuatro veces más. Echa las cuentas y, a pleno rendimiento, la tarea media de Astra cuesta aproximadamente la mitad.

Anthropic plantea un contraargumento razonable. Con el esfuerzo predeterminado, afirma que Opus 5.5 iguala a Astra en Terminal-Bench por alrededor del 40 % del coste, y lo supera en FrontierCode por alrededor del 20 %. Si las pruebas independientes lo confirman, la clasificación cambiará. Por ahora es una afirmación del fabricante, y esperamos datos independientes antes de subir de puesto a un modelo.

Las limitaciones, sin adornos

  • Reserva el esfuerzo máximo para los problemas difíciles. Si lo dejas al máximo para correcciones rutinarias, Opus 5.5 escribirá largos razonamientos que acabarás pagando.
  • El trabajo de seguridad se desvía. Opus 5.5 es tan fuerte en ciberseguridad que Anthropic envía la mayoría de las tareas de seguridad a Opus 4.8, salvo que formes parte de su Cyber Verification Program. La corrección de errores normal no se ve afectada.
  • Las sesiones largas siguen topando con límites. Anthropic amplió los límites de cinco horas en los planes de pago, pero la ejecución de un agente durante horas sobre un repositorio grande todavía puede alcanzarlos.

A quién contratar

Recurre a GPT-6 Astra cuando tengas una cola de tareas bien definidas y quieras cerrarlas al menor coste posible.

Recurre a Claude Opus 5.5 cuando el trabajo sea grande, ambiguo o arriesgado: una migración de framework, una auditoría a fondo o un error que cruza los límites entre servicios. En esos trabajos, el razonamiento cuidadoso vale más que una salida escueta. Es el ingeniero al que le confiaríamos el sistema que nadie más quiere tocar.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Hecho para los trabajos grandes: Los probadores de Anthropic lo usaron para una migración de código de 680.000 líneas terminada en menos de un día, y para una auditoría de 200.000 líneas en menos de tres horas, cuando Opus 5 necesitó más de 20 horas y 2,5 veces más tokens. Cuanto más grande y desordenado es el trabajo, más ventaja saca.
  • Encuentra el error de verdad: Rastrea un fallo hasta su origen en lugar de envolver el síntoma en un try/catch. En el ejemplo de Anthropic, explicó un error de facturación en lenguaje llano: qué se rompió, qué commit lo rompió y cuánto dinero se perdió.
  • Cambios listos para fusionar: FrontierCode v1.1 comprueba si los cambios de código de un modelo son lo bastante buenos para integrarse en proyectos reales. Opus 5.5 obtiene un 54,4 % en la tabla de Anthropic, por poco delante de GPT-6 Astra, con un 53,3 %.
  • Informes que de verdad se pueden leer: Anthropic volvió a entrenar la forma en que escribe el modelo. Las explicaciones empiezan por la conclusión y se ahorran la jerga, lo que hace mucho más rápido revisar el trabajo de un agente.
  • Más difícil de engañar: Según Anthropic, Opus 5.5 empata con Fable 5.1 en la tasa de éxito de inyección de instrucciones más baja de las pruebas de Gray Swan, y es mucho menos propenso que los modelos anteriores a tomar decisiones difíciles de revertir. Eso importa cuando un agente trabaja sin supervisión en tu repositorio.

Limitaciones honestas

  • Locuaz con esfuerzo máximo: Artificial Analysis midió unos 119.000 tokens de salida por tarea con esfuerzo máximo, frente a unos 27.000 de GPT-6 Astra. Con la misma puntuación máxima, eso convierte a Astra en el modelo más barato por tarea terminada, pese a su precio de tarifa más alto.
  • Todavía dominan las cifras del fabricante: El 66,4 % de Terminal-Bench que encabeza los titulares es una ejecución propia de Anthropic (error estándar de ±2,6 puntos), y el 57,9 % de Astra con el que se compara lo aporta OpenAI. La ejecución independiente de Artificial Analysis muestra un empate, no una ventaja.
  • El trabajo de seguridad se desvía: Como Opus 5.5 es muy capaz en ciberseguridad, la mayoría de las tareas de seguridad pasan a Opus 4.8, salvo que te unas al Cyber Verification Program de Anthropic. La corrección de errores habitual no se ve afectada.
  • Límites de uso en sesiones largas: Anthropic amplió los límites de cinco horas en los planes de pago, pero las ejecuciones de agentes de varias horas sobre bases de código grandes todavía pueden alcanzarlos.
03

Resumen de Benchmarks

Terminal-Bench 4.0 — 59,6 %, empate independiente con Astra (66,4 % según el fabricante)

Tareas complejas de varios pasos en una terminal de línea de comandos. Artificial Analysis midió a Opus 5.5 y a GPT-6 Astra (xhigh) con un 59,6 % cada uno. La ejecución propia de Anthropic da a Opus 5.5 un 66,4 % (±2,6), frente al 57,9 % de Astra según OpenAI.

FrontierCode v1.1 — 54,4 %

Si los cambios de código están listos para integrarse en bases de código reales. Tabla de lanzamiento de Anthropic: Opus 5.5 54,4 %, GPT-6 Astra 53,3 %, Fable 5.1 50,3 %, Opus 5 48,0 %.

CursorBench 4.0 — 57,8 %

Tareas de programación más largas dentro del editor Cursor. Anthropic informa de un 57,8 % frente al 51,8 % de Fable 5.1 y el 41,7 % de GPT-5.6 Sol.

Tokens de salida por tarea — ~119k con esfuerzo máximo

Medición de Artificial Analysis con esfuerzo máximo, frente a ~27k de GPT-6 Astra. Es la razón por la que Astra conserva nuestro primer puesto: la misma puntuación máxima por aproximadamente la mitad del coste por tarea.

Precio — $4 / $20 por millón de tokens, $0,20 de lectura en caché

La lectura desde caché, que domina la factura de los agentes de programación, bajó un 60 % respecto a Opus 5. El modo rápido (hasta 2,5 veces más velocidad) cuesta $8/$40.

04

El Veredicto

Claude Opus 5.5 es nuestro modelo de programación número 2, y la distancia con el número 1 nunca había sido tan corta. En la prueba independiente de Terminal-Bench empata con GPT-6 Astra; en las ejecuciones propias de Anthropic de FrontierCode y Terminal-Bench, va por delante. Mantenemos a Astra arriba por un motivo que declaramos abiertamente: a pleno rendimiento, Astra termina el mismo trabajo con aproximadamente una cuarta parte de los tokens de salida, así que cada tarea completada cuesta menos. Si tu trabajo es una migración inabarcable, una auditoría a fondo o un error que nadie más encuentra, Opus 5.5 es el modelo al que se lo confiaríamos, y con el esfuerzo predeterminado es más barato que nunca.

05

Preguntas frecuentes