Guía clasificada

IA Local / Privada — Tu Cerebro en tu Hardware

Aquí tienes una idea radical: ¿y si no tuvieras que enviar tus datos privados a un servidor corporativo solo para obtener una respuesta? Estos son los modelos que descargas, instalas y ejecutas localmente. Sin conexión a internet. Sin cuotas de suscripción. Solo inteligencia pura y sin censura ejecutándose en el silicio de tu escritorio.

Primero, la decisión

Nuestro ranking

Empieza por el ganador y compara después las concesiones que podrían cambiar tu elección.

#1 IA Local / Privada

Qwen3.8 — 27B

Alibaba (Qwen Team)

Qwen3.8-27B es uno de esos raros modelos locales cuyos compromisos encajan con el hardware que la gente realmente tiene: un checkpoint denso de 27B para texto, imágenes, vídeo, programación y agentes con herramientas. Una versión de 4 bits cabe en una GPU de 24 GB, y Apache 2.0 permite mantener el trabajo privado y usarlo comercialmente.

Por qué gana

Qwen declara 61,7 en SWE-bench Pro, 73,0 en Terminal Bench 2.1, 42,2 en DeepSWE 1.1, 84,3 en OSWorld-Verified y 70,7 en CoWorkBench. Ofrece 262.144 tokens de contexto nativo, YaRN opcional hacia 1M, esfuerzo de razonamiento configurable, conservación del razonamiento entre turnos y comprensión nativa de imagen y vídeo.

La Trampa

Son pruebas del día del lanzamiento, no una verdad asentada. Casi todas las cifras principales vienen de la tabla de Qwen; algunas usan el arnés de Claude Code, tareas corregidas, prompts especiales o pruebas internas. El paquete Q4_K_M habitual ronda 18 GB con su proyector visual, pero la sobrecarga y la caché KV aún limitan el contexto que cabe en una tarjeta de 24 GB.

9.2 Nota editorial
Leer reseña
Ideal para

Qwen3.8-27B es uno de esos raros modelos locales cuyos compromisos encajan con el hardware que la gente realmente tiene: un checkpoint denso de 27B para texto, imágenes, vídeo, programación y agentes con herramientas. Una versión de 4 bits cabe en una GPU de 24 GB, y Apache 2.0 permite mantener el trabajo privado y usarlo comercialmente.

Por qué gana

Qwen declara 61,7 en SWE-bench Pro, 73,0 en Terminal Bench 2.1, 42,2 en DeepSWE 1.1, 84,3 en OSWorld-Verified y 70,7 en CoWorkBench. Ofrece 262.144 tokens de contexto nativo, YaRN opcional hacia 1M, esfuerzo de razonamiento configurable, conservación del razonamiento entre turnos y comprensión nativa de imagen y vídeo.

Ten en cuenta

Son pruebas del día del lanzamiento, no una verdad asentada. Casi todas las cifras principales vienen de la tabla de Qwen; algunas usan el arnés de Claude Code, tareas corregidas, prompts especiales o pruebas internas. El paquete Q4_K_M habitual ronda 18 GB con su proyector visual, pero la sobrecarga y la caché KV aún limitan el contexto que cabe en una tarjeta de 24 GB.

#2

Un modelo MoE fenomenalmente eficiente de 284B/13B que domina los flujos de trabajo de programación y agentes mientras se ajusta cómodamente en hardware de nivel medio.

9.1 Nota editorial
Leer reseña
#3

GLM-5.3

Z.ai (Zhipu AI)

El modelo local más interesante que todavía no se puede descargar. GLM-5.3 conserva la base MoE de 744B de GLM-5.2 y obtiene un gran salto en programación y agentes solo mediante postentrenamiento. Z.ai promete los pesos unas dos semanas después del lanzamiento; hasta entonces es un servicio alojado con futuro local creíble.

9.2 Nota editorial
Leer reseña
#4

Kimi K3

Moonshot AI

El primer modelo de pesos abiertos que se parece a un cerebro cerrado de frontera. 2,8 billones de parámetros en una arquitectura mixture-of-experts, visión nativa, un contexto completo de un millón de tokens y una licencia que te permite usarlo comercialmente — todo descargable en una máquina bajo tu control. El problema es la máquina: necesita un centro de datos, no un escritorio.

8.5 Nota editorial
Leer reseña
#5

Gemma 4

Google DeepMind

No es un modelo — son cinco. Gemma 4 de Google DeepMind es una familia que abarca todo, desde una astilla de 2 mil millones de parámetros que corre en tu teléfono hasta una bestia de 31 mil millones para servidores. Cada miembro tiene una arquitectura diferente, fortalezas diferentes y requisitos de hardware diferentes. El E2B cabe en 1 GB de RAM. El 12B Unified corre una IA multimodal completa en la GPU de una laptop. El 26B MoE activa solo 3,8B parámetros por token. Todos Apache 2.0, todos con pesos abiertos. Esta guía recorre cada uno para que sepas exactamente cuál Gemma se ajusta a tu hardware y tu flujo de trabajo.

8.2 Nota editorial
Leer reseña
Preguntas respondidas

Preguntas frecuentes