Todo desarrollador ha trabajado al lado de dos tipos de compañero.
Una es brillante y minuciosa, y te suelta una charla de quince minutos cada vez que le haces una pregunta. El otro simplemente se inclina sobre tu teclado, escribe cuarenta líneas, ejecuta las pruebas y dice: «prueba con esto».
En las alineaciones de OpenAI y Anthropic, la compañera cuidadosa y cara se lleva la mayoría de los títulos. Grok 4.7 es el rápido, lo bastante barato como para preguntarle cien veces al día.
Lanzado el 21 de septiembre de 2026, Grok 4.7 ocupa el quinto puesto de nuestra clasificación de programación. Su papel es ser el compañero de programación con mejor relación calidad-precio del grupo de cabeza.
Las mejoras que importan a quien programa
Grok 4.6 era un aspirante interesante. Grok 4.7 da un paso claro adelante en todas las pruebas de programación que ha publicado xAI:
- DeepSWE v1.1, tareas de ingeniería complejas en bases de código reales: del 65,2 % al 71,0 % (con esfuerzo alto). En la tabla de xAI, eso queda ligeramente por delante del 70,0 % de Claude Fable 5.1.
- CursorBench 4.0, tareas de programación más largas dentro del editor Cursor: del 40,4 % al 46,3 %.
- Terminal-Bench 4.0, trabajo de varias horas en la línea de comandos: del 20,3 % al 37,6 %, casi el doble.
xAI atribuye las mejoras a un modelo base más grande, a un entrenamiento mucho más largo con tareas que duran horas y a un trabajo específico para que revise sus propias respuestas y maneje el contexto largo. En la práctica, eso significa menos cambios a medio terminar y menos errores dichos con total seguridad.
Las cuentas de programar dentro del editor
Cuando programas en Cursor o en un editor similar, la IA no se consulta una vez al día, sino constantemente. Lee tus archivos, propone cambios, explica un error, reescribe una función y vuelve a empezar.
A $2 por millón de tokens de entrada y $6 por millón de salida, Grok 4.7 tiene el precio de salida más bajo entre los mejores modelos de programación. Para comparar: GPT-6 Sol cuesta $10, Claude Opus 5.5 $20 y GPT-6 Astra $50. Si trabajas todo el día en el editor, esa diferencia es dinero de verdad.
También hay una variante rápida que genera texto al doble de velocidad por el doble de precio. Es útil cuando estás esperando cada respuesta.
Dónde todavía se queda corto
Las ejecuciones largas sin supervisión. Terminal-Bench 4.0 es la prueba que mejor predice si puedes dejar a un agente solo en una terminal durante horas. El 37,6 % de Grok 4.7 es una gran mejora, pero GPT-6 Astra y Claude Opus 5.5 obtienen ambos un 59,6 % en pruebas independientes, y Fable 5.1 logra un 57,9 % en la propia tabla de xAI. Para el trabajo autónomo durante la noche, esos modelos se pierden mucho menos.
Los mejores resultados en el editor. En CursorBench 4.0, Grok queda por detrás de Claude Fable 5.1 (51,8 %) y del 57,8 % que Anthropic atribuye a Claude Opus 5.5.
Los rivales más nuevos. xAI compara Grok 4.7 con GPT-5.6 Sol y Fable 5.1. GPT-6 Sol salió al día siguiente a un precio similar y todavía no hemos visto una comparación directa independiente. Todas las cifras de Grok de este artículo son de la propia xAI.
El veredicto
Para ejecuciones largas de agentes sin supervisión, elige GPT-6 Astra. Para trabajo profundo de arquitectura en una base de código grande, elige Claude Opus 5.5.
Pero para las horas que pasas cada día en tu editor, corrigiendo errores, escribiendo pruebas y refactorizando componentes, Grok 4.7 es un compañero fuerte, rápido y muy barato. Pruébalo con tu propio código frente a GPT-6 Sol; lo más probable es que uno de los dos se convierta en tu herramienta de cada día.