Puesto #4 Ecosistema Diario — Los Asistentes Líderes
Google DeepMind

Gemini 3.1 Pro

Gemini 3.1 Pro es el especialista reflexivo de Google: un buque insignia veterano que aún sobresale en ciencia, lógica nueva, documentos extensos e investigación multimodal. La familia Flash es más rápida y barata, pero 3.1 Pro conserva valor cuando importa más la calidad del análisis que llegar primero.

Actualizado 14 de agosto de 2026 Multi-modalReasoningLong context
Ideal para

Gemini 3.1 Pro es el especialista reflexivo de Google: un buque insignia veterano que aún sobresale en ciencia, lógica nueva, documentos extensos e investigación multimodal. La familia Flash es más rápida y barata, pero 3.1 Pro conserva valor cuando importa más la calidad del análisis que llegar primero.

Por qué gana

Al lanzarse obtuvo 77,1 % en ARC-AGI-2, 94,3 % en GPQA Diamond, 44,4 % en Humanity's Last Exam sin herramientas y 80,6 % en SWE-Bench Verified. Admite texto, imágenes, audio, vídeo y PDF dentro de un contexto de un millón de tokens.

Ten en cuenta

Seis meses después continúa en Preview y cuesta 2/12 dólares por millón de tokens hasta 200k de contexto. Su sucesor 3.5 Pro incumplió el objetivo de junio y quizá fue adelantado por la hoja de ruta de Gemini 4; 3.7 Flash ocupa ya buena parte del papel de modelo de batalla.

01

Lo que realmente es

Imagine entregar la misma carpeta difícil a tres compañeros. El primero lee cada página, contrasta notas y gráficos y devuelve un argumento cuidadoso. El segundo avanza deprisa, llama a las herramientas necesarias y convierte la carpeta en un panel antes de comer. El tercero procesa mil carpetas similares a la vez y extrae los mismos doce campos sin agotar el presupuesto.

Es una buena imagen de la familia Gemini actual. 3.1 Pro es el analista deliberado; 3.7 Flash, el constructor y agente rápido; 3.5 Flash-Lite, la línea de producción económica. La palabra Pro no hace al primero superior en todo: indica el compromiso para el que fue diseñado.

Un buque insignia que envejeció en público

Google lanzó Gemini 3.1 Pro en Preview el 19 de febrero de 2026. La mejora central era el razonamiento. En ARC-AGI-2—acertijos donde hay que descubrir reglas visuales desconocidas—pasó del 31,1 % de Gemini 3 Pro al 77,1 %. Añadió 94,3 % en GPQA Diamond y 44,4 % en Humanity’s Last Exam sin herramientas.

Artificial Analysis llegó a una conclusión parecida: 57 puntos, primer lugar y liderazgo en seis de diez componentes. Midió unos 114 tokens por segundo, rápidos para un gran modelo de razonamiento de aquel momento, y destacó el precio de 2/12 dólares frente a otros buques insignia.

La fecha importa. Una clasificación es una fotografía, no un cinturón vitalicio. Seis meses de lanzamientos movieron el terreno. 3.1 Pro no se volvió menos inteligente; los demás mejoraron en programación prolongada, control de ordenador y flujos empresariales.

Dónde conserva su valor

Rinde mejor cuando el problema es difícil antes de ser repetitivo. Un científico combina artículo e imágenes microscópicas; un investigador, entrevista, cronología e informe financiero; un equipo de producto, grabación de pantalla y código. Todo cabe en una consulta multimodal de hasta un millón de tokens.

Es análisis, no generación de medios. La respuesta de 3.1 Pro es texto. Veo crea vídeo, Nano Banana imágenes y Lyria música. Conectarlos en una aplicación no los convierte en capacidades de un solo modelo, igual que un director de orquesta no toca personalmente cada instrumento.

El contexto es una mesa enorme, no memoria fotográfica. En MRCR, Google pasa de 84,9 % de media a 128k a solo 26,3 % en la prueba puntual de 1M. Si todo depende de una frase en la página 4.000, subirlo todo y confiar es mala arquitectura. Reduzca el corpus, etiquete fuentes, pida páginas y verifique.

La larga espera de Gemini 3.5 Pro

El 19 de mayo Google dijo que 3.5 Pro ya se usaba internamente y llegaría «el mes próximo». Junio terminó sin él. El 16 de julio Bloomberg informó de meses de retraso: los intentos de mejorar, especialmente el código, no alcanzaban las metas internas.

Cinco días después Google presentó 3.6 Flash y 3.5 Flash-Lite. Ahora Pro estaba «probándose con socios» y saldría «cuando estuviera listo». En el mismo anuncio reveló que el preentrenamiento más ambicioso para Gemini 4 ya había comenzado. En agosto la página pública todavía promete “3.5 Pro coming soon” encima del antiguo 3.1 Pro.

SemiAnalysis dice que se canceló discretamente. Los indicios hacen creíble esa lectura, pero Google no la confirmó. Puede estar cancelado, renombrado, absorbido por Gemini 4 o sometido a una reconstrucción. La conclusión práctica es sencilla: no compre una suscripción ni diseñe un sistema alrededor de una promesa sin endpoint.

El ecosistema siguió avanzando

Gemini 3.7 Flash, disponible de forma general desde el 13 de agosto, es ahora destino recomendado incluso para muchas cargas de 3.1 Pro. Tiene contexto de 1M, salida de 64k, herramientas y pensamiento bajo, medio o alto. Google publica 43,6 % en FrontierCode, 65,3 % en DeepSWE, 85,8 % en Terminal-Bench y 34 % en GDP.pdf. Su índice AA es 56 y su velocidad ronda 340 tokens por segundo. Cuesta 0,75/3,75 dólares hasta diciembre y 1,50/7,50 después.

3.5 Flash-Lite cubre otra capa. Es estable, multimodal, tiene 1M de contexto, cuesta 0,30/2,50 y ronda 350 tokens por segundo. Su trabajo natural es analizar documentos, clasificar, extraer recibos, alimentar subagentes de búsqueda y producir candidatos paralelos. Mejora ampliamente a 3.1 Flash-Lite en Terminal-Bench, contexto largo y GDPval-AA. No convierte Lite en Pro; lo convierte en una cinta transportadora sorprendentemente capaz.

La elección práctica

Use 3.1 Pro si sus evaluaciones muestran mejor ciencia, investigación o lógica desconocida. Use 3.7 Flash por defecto en nuevos agentes, interfaces, automatización con herramientas y trabajo masivo. Use 3.5 Flash-Lite detrás de escena para tareas pequeñas y bien definidas.

Y espere un endpoint antes de creer en 3.5 Pro. Los nombres de modelos son promesas; los endpoints son productos.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Excelente razonamiento abstracto y científico: Sus resultados de 77,1 % en ARC-AGI-2, 94,3 % en GPQA y 44,4 % en HLE lo situaron entre los mejores de febrero. Las pruebas son mapas, no el territorio, pero juntas señalan facilidad excepcional con lógica desconocida, conceptos técnicos e investigación.
  • Evidencia multimodal en un solo análisis: Puede razonar conjuntamente sobre texto, imágenes, audio, vídeo y PDF. Un investigador conecta el tono de una entrevista con una gráfica y una demostración sin convertirlo todo manualmente en prosa. La salida es texto; Veo, Nano Banana y Lyria son modelos aparte.
  • Una mesa enorme para documentos y código: Un millón de tokens aloja expedientes, colecciones científicas o repositorios grandes. Capacidad no equivale a memoria perfecta—Google publica solo 26,3 % en su MRCR puntual de 1M—por lo que conviene reducir fuentes y exigir citas.
  • Código y herramientas fuertes para su generación: Al inicio registró 80,6 % SWE-Bench Verified, 68,5 % Terminal-Bench 2.0, 85,9 % BrowseComp y 69,2 % MCP Atlas. Admite funciones, salida estructurada, búsqueda de Google y ejecución de código.
  • Disponible en las plataformas profesionales de Google: Figura en Gemini, AI Studio, API, productos empresariales, AI Mode, Antigravity y NotebookLM. Para una organización instalada en Workspace y Cloud, acceso y gobierno pueden pesar más que una pequeña ventaja de benchmark.

Limitaciones honestas

  • El sucesor prometido quedó en el limbo: Google dijo en mayo que 3.5 Pro saldría en junio. El plazo pasó; Bloomberg informó de meses de retraso y mejoras de programación por debajo de los objetivos. Google cambió después a ‘pruebas con socios’ y lanzamiento cuando estuviera listo.
  • La cancelación es plausible, no oficial: SemiAnalysis afirma que se canceló discretamente. Dos generaciones Flash posteriores y el entrenamiento ya iniciado de Gemini 4 lo hacen creíble, pero la página de Google aún dice ‘coming soon’. Cancelación, cambio de nombre o gran reconstrucción son posibilidades, no hechos.
  • Flash encaja mejor en mucha producción: 3.7 Flash está en GA, es más fuerte en numerosas pruebas modernas y cuesta temporalmente 0,75/3,75 dólares. 3.5 Flash-Lite cuesta 0,30/2,50 y está diseñado para extracción documental y subagentes paralelos.
  • Preview y la caída del contexto largo exigen cautela: El ciclo de vida es menos seguro y un millón de tokens no garantiza recuperar cada dato enterrado. Producción necesita versiones fijadas, alternativas probadas, citas y revisión independiente de respuestas importantes.
03

Resumen de Benchmarks

ARC-AGI-2 — 77,1 %

Resultado verificado de Google en acertijos visuales con reglas nuevas, frente a 31,1 % de Gemini 3 Pro. La evidencia más clara de su salto en razonamiento abstracto.

GPQA Diamond — 94,3 %

Preguntas científicas difíciles de posgrado sin herramientas. Apoya su uso en ciencia, pero no convierte en fiable una afirmación sin fuente.

SWE-Bench Verified — 80,6 %

Gran resultado en incidencias reales de repositorios. Pruebas posteriores muestran que sigue siendo capaz sin continuar en la frontera de programación.

Artificial Analysis Intelligence Index — 57 al lanzamiento

Primero en febrero y unos 114 tokens de salida por segundo. Una foto histórica importante, no una afirmación de liderazgo actual.

04

El Veredicto

Gemini 3.1 Pro sigue siendo buen especialista para razonamiento difícil, ciencia y síntesis cuidadosa de pruebas distintas. Para producción nueva, 3.7 Flash suele ser la opción general sensata; 3.5 Flash-Lite es el motor económico de extracción y subagentes. De 3.5 Pro no dé nada por hecho hasta que exista un endpoint: retrasos, informe de cancelación y Gemini 4 sugieren que el producto con ese nombre quizá nunca llegue.

05

Preguntas frecuentes