Imagine entregar la misma carpeta difícil a tres compañeros. El primero lee cada página, contrasta notas y gráficos y devuelve un argumento cuidadoso. El segundo avanza deprisa, llama a las herramientas necesarias y convierte la carpeta en un panel antes de comer. El tercero procesa mil carpetas similares a la vez y extrae los mismos doce campos sin agotar el presupuesto.
Es una buena imagen de la familia Gemini actual. 3.1 Pro es el analista deliberado; 3.7 Flash, el constructor y agente rápido; 3.5 Flash-Lite, la línea de producción económica. La palabra Pro no hace al primero superior en todo: indica el compromiso para el que fue diseñado.
Un buque insignia que envejeció en público
Google lanzó Gemini 3.1 Pro en Preview el 19 de febrero de 2026. La mejora central era el razonamiento. En ARC-AGI-2—acertijos donde hay que descubrir reglas visuales desconocidas—pasó del 31,1 % de Gemini 3 Pro al 77,1 %. Añadió 94,3 % en GPQA Diamond y 44,4 % en Humanity’s Last Exam sin herramientas.
Artificial Analysis llegó a una conclusión parecida: 57 puntos, primer lugar y liderazgo en seis de diez componentes. Midió unos 114 tokens por segundo, rápidos para un gran modelo de razonamiento de aquel momento, y destacó el precio de 2/12 dólares frente a otros buques insignia.
La fecha importa. Una clasificación es una fotografía, no un cinturón vitalicio. Seis meses de lanzamientos movieron el terreno. 3.1 Pro no se volvió menos inteligente; los demás mejoraron en programación prolongada, control de ordenador y flujos empresariales.
Dónde conserva su valor
Rinde mejor cuando el problema es difícil antes de ser repetitivo. Un científico combina artículo e imágenes microscópicas; un investigador, entrevista, cronología e informe financiero; un equipo de producto, grabación de pantalla y código. Todo cabe en una consulta multimodal de hasta un millón de tokens.
Es análisis, no generación de medios. La respuesta de 3.1 Pro es texto. Veo crea vídeo, Nano Banana imágenes y Lyria música. Conectarlos en una aplicación no los convierte en capacidades de un solo modelo, igual que un director de orquesta no toca personalmente cada instrumento.
El contexto es una mesa enorme, no memoria fotográfica. En MRCR, Google pasa de 84,9 % de media a 128k a solo 26,3 % en la prueba puntual de 1M. Si todo depende de una frase en la página 4.000, subirlo todo y confiar es mala arquitectura. Reduzca el corpus, etiquete fuentes, pida páginas y verifique.
La larga espera de Gemini 3.5 Pro
El 19 de mayo Google dijo que 3.5 Pro ya se usaba internamente y llegaría «el mes próximo». Junio terminó sin él. El 16 de julio Bloomberg informó de meses de retraso: los intentos de mejorar, especialmente el código, no alcanzaban las metas internas.
Cinco días después Google presentó 3.6 Flash y 3.5 Flash-Lite. Ahora Pro estaba «probándose con socios» y saldría «cuando estuviera listo». En el mismo anuncio reveló que el preentrenamiento más ambicioso para Gemini 4 ya había comenzado. En agosto la página pública todavía promete “3.5 Pro coming soon” encima del antiguo 3.1 Pro.
SemiAnalysis dice que se canceló discretamente. Los indicios hacen creíble esa lectura, pero Google no la confirmó. Puede estar cancelado, renombrado, absorbido por Gemini 4 o sometido a una reconstrucción. La conclusión práctica es sencilla: no compre una suscripción ni diseñe un sistema alrededor de una promesa sin endpoint.
El ecosistema siguió avanzando
Gemini 3.7 Flash, disponible de forma general desde el 13 de agosto, es ahora destino recomendado incluso para muchas cargas de 3.1 Pro. Tiene contexto de 1M, salida de 64k, herramientas y pensamiento bajo, medio o alto. Google publica 43,6 % en FrontierCode, 65,3 % en DeepSWE, 85,8 % en Terminal-Bench y 34 % en GDP.pdf. Su índice AA es 56 y su velocidad ronda 340 tokens por segundo. Cuesta 0,75/3,75 dólares hasta diciembre y 1,50/7,50 después.
3.5 Flash-Lite cubre otra capa. Es estable, multimodal, tiene 1M de contexto, cuesta 0,30/2,50 y ronda 350 tokens por segundo. Su trabajo natural es analizar documentos, clasificar, extraer recibos, alimentar subagentes de búsqueda y producir candidatos paralelos. Mejora ampliamente a 3.1 Flash-Lite en Terminal-Bench, contexto largo y GDPval-AA. No convierte Lite en Pro; lo convierte en una cinta transportadora sorprendentemente capaz.
La elección práctica
Use 3.1 Pro si sus evaluaciones muestran mejor ciencia, investigación o lógica desconocida. Use 3.7 Flash por defecto en nuevos agentes, interfaces, automatización con herramientas y trabajo masivo. Use 3.5 Flash-Lite detrás de escena para tareas pequeñas y bien definidas.
Y espere un endpoint antes de creer en 3.5 Pro. Los nombres de modelos son promesas; los endpoints son productos.