Durante años, la IA de frontera siguió una regla de restaurante: cuanto más elegante era el menú, más atención exigía la cuenta. Grok 4.6 rompe ese patrón. Obtiene 61 puntos en el Índice de Inteligencia de Artificial Analysis, empata con GPT-5.6 Sol y solo queda por detrás de las configuraciones máximas de Opus 5 y Fable 5. Sin embargo, conserva el precio de $2 por millón de tokens de entrada y $6 por millón de salida. Esta vez, el salto de capacidad no viene acompañado de una tarifa de lujo.
La historia más reveladora aparece debajo del índice compuesto. En GDPVal-AA v2, que evalúa trabajo profesional realizado por agentes, Grok alcanza 1753 Elo. En AA-Briefcase, centrado en tareas largas de investigación, análisis y creación de entregables, obtiene 1577 Elo. Artificial Analysis observó una media aproximada de 53 rondas y 0.5 mil millones de tokens de entrada por tarea. Opus 5 max necesitó alrededor de 103 rondas y 2.0 mil millones. Imagina dos equipos que entregan informes de calidad parecida: uno celebra la mitad de reuniones y relee solo una cuarta parte del archivo. Esa eficiencia reduce la factura y también disminuye las oportunidades de que el agente olvide el objetivo durante una trayectoria larga.
xAI entrenó expresamente para este tipo de resistencia. El anuncio describe una fase suplementaria más larga, nuevas trayectorias de razonamiento y software, y aprendizaje por refuerzo en trabajo de conocimiento, programación general, desarrollo web, diseño asistido por ordenador y otros entornos con herramientas. El modelo dispone de 500.000 tokens de contexto y niveles de razonamiento low, medium, high y xhigh. Está disponible en Grok Build, Cursor, la API de xAI, OpenRouter, Vercel y Cloudflare. Existe una variante rápida para reducir la espera, aunque cobra el doble por token.
Nada de esto equivale a ganar todas las disciplinas. La evidencia más clara de Grok está en el trabajo de conocimiento con agentes. En la tabla de xAI, su 65.9% en DeepSWE v1.1 queda detrás de GPT-5.6 Sol y Fable 5; su 26% en Terminal-Bench v3.0 queda todavía más lejos de los resultados de ambos, situados alrededor del 34%. Además, varios resultados rivales proceden de tarjetas de modelo o clasificaciones públicas con herramientas, prompts y reglas de parada distintas. Una diferencia pequeña debe leerse como una zona de rendimiento similar, no como una medida exacta al milímetro.
Los primeros testimonios de uso también merecen atención. Algunos desarrolladores describen cambios de seguridad peligrosos o una reacción poco fiable después de un fallo. Son anécdotas, no una estimación de frecuencia, pero muestran una clase de error que un promedio de benchmark puede esconder. La respuesta prudente es ejecutar al agente en un entorno aislado, ofrecerle las mínimas credenciales, exigir cambios pequeños, inspeccionar los diffs y mantener pruebas y aprobación humana. Un contexto de 500K puede contener un proyecto entero; no garantiza que el modelo detecte el dato decisivo ni que cite correctamente una fuente.
Por eso la conclusión práctica no es «confía más en Grok», sino «puedes permitirte verificar Grok mejor». Artificial Analysis mide unos $0.84 por tarea, de modo que una segunda ejecución, una comprobación de fuentes o un modelo revisor resultan razonables. Para investigación, análisis, documentos de trabajo y agentes prolongados, Grok 4.6 ya es una opción real de frontera con ventaja económica. Cuando una afirmación tenga consecuencias serias o el agente pueda tocar producción, una persona debe seguir en la puerta.