Puesto #7 Ecosistema Diario — Los Asistentes Líderes
xAI

Grok 4.7

Grok 4.7 mantiene el precio bajo de Grok 4.6 —$2 de entrada y $6 de salida por millón de tokens—, pero es un modelo claramente más fuerte y más cuidadoso. xAI lo entrenó con tareas más largas y difíciles y le enseñó a revisar su propio trabajo. Es la forma más económica de conseguir ayuda casi de primer nivel para trabajo de oficina, borradores jurídicos y matemáticas de ingeniería.

Actualizado 27 de septiembre de 2026 Value Frontier$2/$6 PricingSelf-Verification
Ideal para

Grok 4.7 mantiene el precio bajo de Grok 4.6 —$2 de entrada y $6 de salida por millón de tokens—, pero es un modelo claramente más fuerte y más cuidadoso. xAI lo entrenó con tareas más largas y difíciles y le enseñó a revisar su propio trabajo. Es la forma más económica de conseguir ayuda casi de primer nivel para trabajo de oficina, borradores jurídicos y matemáticas de ingeniería.

Por qué gana

El mismo precio de $2/$6 que Grok 4.6, con una variante rápida que va al doble de velocidad por el doble de precio. En la tabla de lanzamiento de xAI, Grok 4.7 logra la mejor puntuación en Harvey Legal Agent Benchmark (19,6 %, frente al 6,7 % de Claude Fable 5.1) y en EEBench de ingeniería eléctrica (64,0 %). En AA Briefcase, una prueba de trabajo de oficina de varias horas, se queda cerca de Fable 5.1 (1.657 frente a 1.678). xAI lo presenta como su modelo más sólido hasta la fecha para rechazar peticiones dañinas y resistir jailbreaks.

Ten en cuenta

Su tabla de lanzamiento lo compara con GPT-5.6 Sol y Claude Fable 5.1, no con los más recientes Claude Opus 5.5 o GPT-6 Sol, así que su posición frente a los mejores modelos actuales aún no está clara. Se queda claramente atrás en el trabajo largo de terminal (37,6 % en Terminal-Bench 4.0 frente al 57,9 % de Fable 5.1) y en razonamiento clínico. Todas las cifras son de la propia xAI.

01

Lo que realmente es

Imagina una aerolínea de bajo coste que mantiene el precio de sus billetes pero, sin hacer ruido, cambia a un avión más grande y mejor.

Eso es, más o menos, lo que hizo xAI con Grok 4.7, lanzado el 21 de septiembre de 2026. El precio no ha cambiado: $2 por millón de tokens de entrada y $6 por millón de salida, exactamente igual que Grok 4.6. Lo que ha cambiado es el modelo que hay debajo.

Qué hay de nuevo bajo el capó

xAI describe tres cambios, dicho en palabras sencillas:

  1. Un modelo base más grande. xAI dice que la versión 4.7 se apoya en unos cimientos más grandes que la 4.6. No publica el número de parámetros en su anuncio, así que toma como no confirmada cualquier cifra concreta que leas en otra parte.
  2. Un entrenamiento más largo y más duro. El modelo se entrenó con aprendizaje por refuerzo en tareas que tardan muchas horas en completarse, justo el tipo de trabajo en el que los modelos anteriores perdían el hilo a mitad de camino.
  3. Revisar su propio trabajo. xAI lo entrenó específicamente para comprobar sus respuestas y manejar con más fiabilidad los documentos largos.

El resultado es un modelo que aguanta mejor una tarea larga y detecta sus propios errores antes que tú.

Dónde nos sorprendió

Las cifras más interesantes de la tabla de lanzamiento de xAI no son las de programación. Están en áreas donde no esperarías ver en cabeza a un modelo económico.

  • Trabajo jurídico. En Harvey Legal Agent Benchmark, una prueba de lo bien que un agente de IA resuelve tareas jurídicas reales, Grok 4.7 obtuvo un 19,6 %. Eso está por delante de Claude Fable 5.1 (6,7 %) y GPT-5.6 Sol (2,5 %). Es una prueba brutalmente difícil y todos puntúan bajo, pero Grok quedó primero en esa comparación.
  • Matemáticas de ingeniería. En EEBench, que evalúa problemas de ingeniería eléctrica, logró un 64,0 %, por delante del 56,4 % de Fable 5.1.
  • Trabajo de oficina. En AA Briefcase, una prueba de tareas de oficina de varias horas, como elaborar documentos y presentaciones, obtuvo 1.657, justo por detrás del 1.678 de Fable 5.1 y muy por encima del 1.546 de Grok 4.6.

En pocas palabras: en trabajo real de oficina y profesional, Grok 4.7 ya juega en la misma liga que modelos que cuestan varias veces más.

Más seguro de lo que dice su fama

Grok tiene fama de ser el chatbot con menos barreras. Con la versión 4.7, esa fama se ha quedado anticuada. xAI construyó lo que describe como un sistema de seguridad completamente nuevo y afirma que es su modelo más sólido hasta la fecha para rechazar peticiones peligrosas y resistir jailbreaks. También asegura que el modelo rara vez bloquea trabajo legítimo, como la investigación en seguridad defensiva.

Grok sigue tendiendo a responder de forma directa en lugar de envolver sus respuestas en advertencias. Pero eso es una cuestión de estilo, no de falta de seguridad.

La pega, sin rodeos

Todavía no se ha medido con los rivales más nuevos. La tabla de xAI compara Grok 4.7 con GPT-5.6 Sol y Claude Fable 5.1. Un día después de su lanzamiento, Anthropic sacó Claude Opus 5.5 y OpenAI sacó GPT-6 Sol, dos competidores fuertes y con buen precio. Hasta que las pruebas independientes los pongan lado a lado, la posición exacta de Grok es incierta.

El trabajo largo de terminal sigue siendo un punto débil. En Terminal-Bench 4.0, que evalúa trabajo de varias horas en la línea de comandos, Grok 4.7 obtuvo un 37,6 %. Es casi el doble que Grok 4.6, pero muy por detrás del 57,9 % de Fable 5.1.

La medicina no es su fuerte. En HealthBench Professional, una prueba de razonamiento clínico, logró un 56,7 %, por debajo de GPT-5.6 Sol y de Fable 5.1.

Todas son cifras de xAI. Sus ventajas en derecho e ingeniería son emocionantes, pero nos gustaría verlas confirmadas de forma independiente.

A quién le conviene

Si usas IA todo el día para documentos, análisis y preguntas técnicas, y la factura mensual importa, Grok 4.7 merece una prueba seria. Te da la mayor parte de la calidad de los mejores modelos por una fracción del coste.

Si necesitas el criterio más cuidadoso disponible, elige Claude Opus 5.5. Si quieres un agente que maneje programas en tu ordenador, elige GPT-6 Astra. Para todo lo que queda en medio, Grok 4.7 es la mejor relación calidad-precio cerca de la cima.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Trabajo casi de primer nivel a precio de saldo: $2 por millón de tokens de entrada y $6 por millón de salida. Es menos de un tercio del precio de salida de Claude Opus 5.5 y alrededor de una octava parte del de GPT-6 Astra. Para los equipos que usan IA todo el día, la diferencia se nota en la factura mensual.
  • Sorprendentemente bueno en trabajo jurídico: En Harvey Legal Agent Benchmark, Grok 4.7 obtuvo un 19,6 % en la tabla de xAI, por delante de Claude Fable 5.1 (6,7 %) y GPT-5.6 Sol (2,5 %). Es una prueba muy difícil en la que todos los modelos siguen puntuando bajo, pero Grok encabezó la comparación.
  • Bueno con las matemáticas de ingeniería: En EEBench, una prueba de problemas de ingeniería eléctrica, logró un 64,0 %, por delante de Fable 5.1 (56,4 %) y muy por encima de Grok 4.6 (53,0 %).
  • Revisa su propio trabajo: xAI entrenó a Grok 4.7 con tareas más largas y difíciles, y mejoró específicamente cómo comprueba sus respuestas y cómo maneja documentos largos. En AA Briefcase, una prueba de trabajo de oficina de varias horas, pasó de 1.546 a 1.657, cerca del 1.678 de Fable 5.1.
  • Más seguro sin sermonear: xAI reconstruyó el sistema de seguridad. Presenta a Grok 4.7 como su modelo más sólido hasta la fecha para rechazar peticiones peligrosas y resistir jailbreaks, y aun así rara vez bloquea trabajo legítimo como la investigación en seguridad defensiva.

Limitaciones honestas

  • No se ha comparado con los rivales más nuevos: La tabla de xAI enfrenta a Grok 4.7 con GPT-5.6 Sol y Claude Fable 5.1. Claude Opus 5.5 y GPT-6 Sol llegaron un día después, así que todavía faltan comparaciones directas independientes.
  • Más flojo en sesiones largas de terminal: En Terminal-Bench 4.0, que evalúa trabajo de varias horas en la línea de comandos, obtuvo un 37,6 %, un gran salto desde el 20,3 % de Grok 4.6, pero muy por detrás del 57,9 % de Fable 5.1.
  • Por detrás en medicina: En HealthBench Professional, una prueba de razonamiento clínico, logró un 56,7 %, por debajo de GPT-5.6 Sol (60,5 %) y Fable 5.1 (62,1 %).
  • Solo cifras del fabricante: Todas las cifras de este artículo proceden del anuncio de xAI. Toma sus ventajas en derecho e ingeniería como prometedoras hasta que las confirmen pruebas independientes.
03

Resumen de Benchmarks

Harvey Legal Agent Benchmark — 19,6 %

Trabajo jurídico con agentes. Tabla de xAI: Grok 4.7 19,6 %, Grok 4.6 15,8 %, Claude Fable 5.1 6,7 %, GPT-5.6 Sol 2,5 %. Una prueba muy difícil; es normal que las puntuaciones absolutas sean bajas.

EEBench — 64,0 %

Resolución de problemas de ingeniería eléctrica. En la misma tabla, Grok 4.6 obtuvo un 53,0 %, Claude Fable 5.1 un 56,4 % y GPT-5.6 Sol un 39,4 %.

AA Briefcase v1.1 — 1.657

Tareas de oficina de varias horas, como documentos y presentaciones. Sube desde 1.546 en Grok 4.6 y queda justo por detrás de Claude Fable 5.1, con 1.678.

Terminal-Bench 4.0 — 37,6 %

Trabajo de terminal de varias horas. Una gran mejora frente a Grok 4.6 (20,3 %), a la par de GPT-5.6 Sol (37,3 %), pero muy por detrás de Claude Fable 5.1 (57,9 %) en la tabla de xAI. (La ejecución propia de Anthropic sitúa a Fable 5.1 en el 55,8 %; las pruebas independientes sitúan a GPT-6 Astra y Claude Opus 5.5 en el 59,6 %).

Precio — $2 / $6 por millón de tokens

Sin cambios respecto a Grok 4.6. Una variante rápida ofrece el doble de velocidad de salida por el doble de precio.

04

El Veredicto

Grok 4.7 mantiene nuestro quinto puesto en Ecosistema cotidiano como el modelo con mejor relación calidad-precio cerca de la cima. No es el asistente más inteligente que se puede comprar. Claude Opus 5.5 y GPT-6 Astra siguen por delante en criterio cuidadoso y en el manejo de software. Pero Grok 4.7 se acerca sorprendentemente en el trabajo de oficina, encabeza su tabla de lanzamiento en las pruebas jurídicas y de ingeniería, y cuesta una fracción. Si usas IA todo el día y vigilas la factura, merece una prueba seria.

05

Preguntas frecuentes