Hay una diferencia entre alguien que escribe código y alguien que entiende un sistema.
La primera persona ve un error que dice undefined is not a function, envuelve esa línea en una comprobación if y sigue adelante. El fallo desaparece. Tres días después se rompe otra cosa, en un sitio que nadie esperaba.
La segunda persona se pregunta por qué el valor era indefinido. Lo sigue hacia atrás a través de los servicios, descubre que una escritura en la base de datos terminaba antes de que se confirmara un mensaje, y corrige el orden para que ese estado erróneo no pueda darse nunca.
Claude Opus 5.5 pertenece claramente al segundo grupo. Lanzado el 22 de septiembre de 2026, ocupa el segundo puesto de nuestra clasificación de programación, más cerca del primero que cualquier modelo anterior.
En qué destaca: trabajos grandes y enrevesados
Las historias de los primeros probadores de Anthropic tienen todas la misma forma: trabajos enormes que antes le llevaban semanas a un equipo.
- Un probador terminó una migración de código de 680.000 líneas en menos de un día.
- Otro auditó y corrigió una base de código de 200.000 líneas en menos de tres horas. Opus 5 necesitó más de 20 horas y 2,5 veces más tokens para el mismo trabajo.
- En una prueba interna, Opus 5.5 y Fable 5.1 reescribieron de C a Rust HAProxy, el popular software que reparte el tráfico web entre servidores, y ambos superaron casi todas las pruebas del propio HAProxy. Opus 5.5 terminó en 9,5 horas en lugar de 12, con un coste un 51 % menor.
Son anécdotas del fabricante, no mediciones independientes, así que tómalas como una señal de la dirección, no como una garantía. Pero el patrón es coherente: cuanto más grande y desordenado el trabajo, más se distancia Opus 5.5.
Además, se explica con claridad. El anuncio de Anthropic lo muestra diagnosticando un error de facturación. En lugar de un muro de detalles técnicos, empieza por el dinero: $1,50 de la caída de ingresos de un cliente se debía a un cambio de precios, y los otros $9,92, a un error en un commit concreto que dejaba de contar el uso del último día de cada mes. Cuando un agente toca tu código, informes así son los que lo mantienen honesto.
Las pruebas: un empate, según quién lleve la cuenta
Aquí conviene ir despacio, porque las tablas del fabricante y las pruebas independientes cuentan historias ligeramente distintas.
Las cifras de Anthropic (septiembre de 2026):
- Terminal-Bench 4.0, que mide trabajo de varios pasos en una terminal de línea de comandos: Opus 5.5 obtuvo un 66,4 % (±2,6 puntos). GPT-6 Astra obtuvo un 57,9 %, cifra comunicada por OpenAI.
- FrontierCode v1.1, que comprueba si los cambios de código son lo bastante buenos para integrarse: Opus 5.5 54,4 %, Astra 53,3 %.
- CursorBench 4.0, con tareas de programación más largas dentro del editor Cursor: Opus 5.5 57,8 %, Fable 5.1 51,8 %.
Las cifras independientes: Artificial Analysis ejecutó Terminal-Bench 4.0 por su cuenta y obtuvo un 59,6 % tanto para Opus 5.5 como para Astra. Empate absoluto.
Nuestra norma es confiar más en las mediciones independientes que en las tablas del fabricante. Eso nos deja un empate en capacidad pura. Así que la clasificación depende de otra cosa.
Por qué GPT-6 Astra conserva el primer puesto
Cuando dos modelos son igual de buenos, los ordenamos por lo que te cuesta una tarea terminada.
Aquí Astra tiene una ventaja clara. Con esfuerzo máximo, Artificial Analysis midió que Opus 5.5 escribía unos 119.000 tokens de salida por tarea, frente a unos 27.000 de Astra. Los tokens de Opus son más baratos ($20 por millón de salida frente a los $50 de Astra), pero usa unas cuatro veces más. Echa las cuentas y, a pleno rendimiento, la tarea media de Astra cuesta aproximadamente la mitad.
Anthropic plantea un contraargumento razonable. Con el esfuerzo predeterminado, afirma que Opus 5.5 iguala a Astra en Terminal-Bench por alrededor del 40 % del coste, y lo supera en FrontierCode por alrededor del 20 %. Si las pruebas independientes lo confirman, la clasificación cambiará. Por ahora es una afirmación del fabricante, y esperamos datos independientes antes de subir de puesto a un modelo.
Las limitaciones, sin adornos
- Reserva el esfuerzo máximo para los problemas difíciles. Si lo dejas al máximo para correcciones rutinarias, Opus 5.5 escribirá largos razonamientos que acabarás pagando.
- El trabajo de seguridad se desvía. Opus 5.5 es tan fuerte en ciberseguridad que Anthropic envía la mayoría de las tareas de seguridad a Opus 4.8, salvo que formes parte de su Cyber Verification Program. La corrección de errores normal no se ve afectada.
- Las sesiones largas siguen topando con límites. Anthropic amplió los límites de cinco horas en los planes de pago, pero la ejecución de un agente durante horas sobre un repositorio grande todavía puede alcanzarlos.
A quién contratar
Recurre a GPT-6 Astra cuando tengas una cola de tareas bien definidas y quieras cerrarlas al menor coste posible.
Recurre a Claude Opus 5.5 cuando el trabajo sea grande, ambiguo o arriesgado: una migración de framework, una auditoría a fondo o un error que cruza los límites entre servicios. En esos trabajos, el razonamiento cuidadoso vale más que una salida escueta. Es el ingeniero al que le confiaríamos el sistema que nadie más quiere tocar.