Guía clasificada

Programación — IA que Escribe Software de Producción

Son agentes de programación, no juguetes de autocompletado. GPT-6 Astra lidera porque termina el trabajo de terminal con menos tokens, mientras que Claude Opus 5.5 empata con él en las pruebas independientes y es el más fuerte con bases de código grandes y enrevesadas. Claude Sonnet 5.5 es la opción rápida, a mitad de precio por token, para errores y funciones bien acotados. GPT-6.1 Sol y Grok 4.7 ofrecen programación casi de primer nivel por una fracción del precio, y GLM-5.3, GLM-5.3-Flash y Qwen3.8-Max completan la lista con opciones de gran relación calidad-precio.

Primero, la decisión

Nuestro ranking

Empieza por el ganador y compara después las concesiones que podrían cambiar tu elección.

#1 Programación

GPT-6 Astra

OpenAI

GPT-6 Astra toma la corona de programación del mismo modo honesto en que la tenía GPT-5.6: terminando el trabajo con forma de agente —sesiones de terminal, pipelines rotos, forensia de incidentes, configuraciones completas de escritorio— ahora respaldado por su nuevo nº 1 en la Code Arena de Arena.ai (WebDev con 1.797 pts) mientras consume aproximadamente un tercio de los tokens de Sol.

Por qué gana

Nuevo nº 1 en la Code Arena de Arena.ai: WebDev con 1.797 pts (ventaja de +35 pts sobre Claude Fable 5.1 Max con 1.762, +109 sobre Opus 5 Max con 1.688 y +180 sobre Sol en el puesto 13), liderando en Data & Analytics, Consumer Product y Content Creation Tools. A ello se suma Terminal-Bench 4.0 en 57,7–57,9% (Fable 5.1: 55,8%), el mejor de la tabla en DeepSWE v1.1 con 74,1%, Terminal-Bench Science en 64,6%, SRE-Bench en 88% pass@1 / 99,2% pass@4 y 100% en ExploitBench. Aunque el arnés propio de Artificial Analysis aún puntúa ligeramente por delante a Fable 5.1 (70 frente a 67), Astra redefine la frontera de Pareto a 40 $/Mtoken combinado y gasta alrededor de un tercio de los tokens de Sol.

La Trampa

Incluso con la corona de nº 1 en Code Arena para WebDev y herramientas de producto, Fable 5(.1) sigue ostentando el récord de resolución de issues en SWE-Bench Pro y lidera en el índice de arnés propio de Artificial Analysis (70 frente a 67). El precio de la API es 2,5 veces el de Sol a 10/50 dólares, las lecturas de caché cuestan cuatro veces los 0,25 $ de Fable 5.1, las respuestas breves se saltan pasos de pulido de informes, y las salvaguardas cibernéticas más fuertes añaden fricción al trabajo cercano a exploits. Las tablas de lanzamiento se movieron tras publicarse: trata cualquier número aislado como ±1–2 puntos.

9.9 Nota editorial
Leer reseña
Ideal para

GPT-6 Astra toma la corona de programación del mismo modo honesto en que la tenía GPT-5.6: terminando el trabajo con forma de agente —sesiones de terminal, pipelines rotos, forensia de incidentes, configuraciones completas de escritorio— ahora respaldado por su nuevo nº 1 en la Code Arena de Arena.ai (WebDev con 1.797 pts) mientras consume aproximadamente un tercio de los tokens de Sol.

Por qué gana

Nuevo nº 1 en la Code Arena de Arena.ai: WebDev con 1.797 pts (ventaja de +35 pts sobre Claude Fable 5.1 Max con 1.762, +109 sobre Opus 5 Max con 1.688 y +180 sobre Sol en el puesto 13), liderando en Data & Analytics, Consumer Product y Content Creation Tools. A ello se suma Terminal-Bench 4.0 en 57,7–57,9% (Fable 5.1: 55,8%), el mejor de la tabla en DeepSWE v1.1 con 74,1%, Terminal-Bench Science en 64,6%, SRE-Bench en 88% pass@1 / 99,2% pass@4 y 100% en ExploitBench. Aunque el arnés propio de Artificial Analysis aún puntúa ligeramente por delante a Fable 5.1 (70 frente a 67), Astra redefine la frontera de Pareto a 40 $/Mtoken combinado y gasta alrededor de un tercio de los tokens de Sol.

Ten en cuenta

Incluso con la corona de nº 1 en Code Arena para WebDev y herramientas de producto, Fable 5(.1) sigue ostentando el récord de resolución de issues en SWE-Bench Pro y lidera en el índice de arnés propio de Artificial Analysis (70 frente a 67). El precio de la API es 2,5 veces el de Sol a 10/50 dólares, las lecturas de caché cuestan cuatro veces los 0,25 $ de Fable 5.1, las respuestas breves se saltan pasos de pulido de informes, y las salvaguardas cibernéticas más fuertes añaden fricción al trabajo cercano a exploits. Las tablas de lanzamiento se movieron tras publicarse: trata cualquier número aislado como ±1–2 puntos.

#2

Claude Opus 5.5

Anthropic

Claude Opus 5.5 es el modelo de programación al que llamar cuando el trabajo es grande y enrevesado: una migración de cientos de miles de líneas, un error que atraviesa cinco servicios, un sistema heredado que ya nadie entiende del todo. En las pruebas de Anthropic supera a GPT-6 Astra; en las pruebas independientes, ambos empatan. Si ocupa nuestro segundo puesto y no el primero es solo porque Astra termina el mismo trabajo de terminal con muchos menos tokens.

9.9 Nota editorial
Leer reseña
#3

Claude Sonnet 5.5

Anthropic

Claude Sonnet 5.5 es el modelo de programación que puedes dejar encendido todo el día: rápido, a la mitad del precio por token de Opus 5.5 y lo bastante bueno como para que la mayoría de correcciones, funciones nuevas y refactorizaciones nunca necesiten el modelo insignia. Eso sí, no subas el control de esfuerzo al máximo: en su nivel más alto escribe más que cualquier modelo que Artificial Analysis haya medido, y algunos resultados empeoran.

9.8 Nota editorial
Leer reseña
#4

GPT-6.1 Sol

OpenAI

GPT-6.1 Sol es el agente de programación que puedes dejar funcionando todo el día sin preocuparte por la factura. En pruebas independientes se sitúa a solo un punto o dos de GPT-6 Astra, el modelo insignia de OpenAI, pero el costo de una tarea típica es menos de una cuarta parte. El precio del token no ha cambiado respecto a GPT-6 Sol ($2 de entrada, $10 de salida por millón), pero releer el código almacenado en caché ahora cuesta solo $0.10 por millón de tokens, y es exactamente en los grandes repositorios donde se nota este ahorro.

9.8 Nota editorial
Leer reseña
#5

Claude Fable 5.1

Anthropic

El motor de razonamiento de clase Mythos refinado para la codificación basada en agentes. Los mismos pesos que el restringido Mythos 5.1, pero optimizado con un descuento de caché del 75% que transforma la economía de la ingeniería a largo plazo. Se implementa mejor en Claude Code, donde su puntaje de 70 en el AA Coding Agent lidera el campo.

9.8 Nota editorial
Leer reseña
#6

Grok 4.7

xAI

Grok 4.7 es el modelo de programación serio más barato cerca de lo más alto de la clasificación. Por $2 de entrada y $6 de salida por millón de tokens, obtiene un 71,0 % en DeepSWE y un 46,3 % en CursorBench 4.0, y funciona de forma nativa en Cursor y Grok Build. Es un gran compañero de programación para el día a día, aunque todavía no es el agente al que dejarías solo en una terminal durante horas.

9.7 Nota editorial
Leer reseña
#7

GLM-5.3

Z.ai (Zhipu AI)

Un agente de programación de pesos abiertos y gran tamaño, entrenado para la parte que viene después de la primera respuesta: planificar, editar, probar, recuperarse y mantener la orientación durante trabajos largos en repositorios.

9.2 Nota editorial
Leer reseña
#8

Qwen3.8-Max

Alibaba / Qwen Team

Un retador de alto valor, visual y de contexto largo para programación, que ahora se ubica en el puesto #6 luego de que pruebas independientes colocaran al modelo insignia GLM-5.3 por delante. Su punto de control del nivel Max descargable sigue siendo extraordinario, pero sus 2.4 billones de parámetros hacen que alojarlo uno mismo sea un proyecto digno de un centro de datos.

9.2 Nota editorial
Leer reseña
#9

GLM-5.3-Flash

Z.ai (Zhipu AI)

Programación y trabajo agéntico cerca de la frontera a precios excepcionalmente bajos, con visión nativa y un contexto de 1M. Aquí «Flash» significa eficiente y barato, no pequeño ni especialmente rápido.

9.2 Nota editorial
Leer reseña
Preguntas respondidas

Preguntas frecuentes