Puesto #4 IA Local / Privada — Tu Cerebro, tu Máquina, tus Reglas
DeepSeek

DeepSeek-V4-Flash-0731

Un eficiente MoE de texto y código con 284B parámetros totales y 13B activos que sigue resultando atractivo en sistemas de la categoría de 128 GB. Los nuevos rivales multimodales han puesto fin a su breve aspiración a la corona de los agentes locales.

Actualizado 29 de agosto de 2026 Open WeightsMIT1M Context
Ideal para

Un eficiente MoE de texto y código con 284B parámetros totales y 13B activos que sigue resultando atractivo en sistemas de la categoría de 128 GB. Los nuevos rivales multimodales han puesto fin a su breve aspiración a la corona de los agentes locales.

Por qué gana

Un salto enorme en capacidad de agente respecto a su versión preliminar: alcanza 82.7 en Terminal Bench 2.1 y 54.4 en DeepSWE. Dispone de una cuantización casi sin pérdidas a 4 bits que ocupa solo 155 GB.

Ten en cuenta

Es exclusivamente de texto, requiere unos 103 GB incluso en una versión agresiva de tres bits y la mayoría de sus puntuaciones estrella como agente proceden del fabricante. Qwen y GLM Flash ofrecen ahora paquetes más potentes o completos para agentes privados.

01

Lo que realmente es

Cuando se habla de IA local, la conversación suele girar en torno a las concesiones. O tienes un modelo gigantesco que necesita una granja de servidores para funcionar, o uno pequeño al que le cuesta mantener el contexto durante una sesión de programación compleja. DeepSeek-V4-Flash-0731 rompe esa dicotomía.

Publicado el 31 de julio de 2026 como una actualización exclusivamente de postentrenamiento, Flash-0731 comparte exactamente la misma arquitectura MoE de 284B parámetros totales y 13B activos que su versión preliminar. Sin embargo, las capacidades que esta actualización libera son asombrosas. En Terminal Bench 2.1 se dispara hasta 82.7, casi igualando al peso pesado propietario Opus 4.8. En DeepSWE salta de unos modestos 7.3 a unos dominantes 54.4. Esto demuestra que no hace falta un billón de parámetros para construir un agente de nivel de frontera; basta con enseñar a un modelo muy eficiente a utilizar herramientas, moverse por terminales y recuperarse de sus propios errores.

La magia de Flash-0731 reside en su dispersión. Como durante la inferencia solo se activan 13B parámetros, necesita mucho menos ancho de banda de memoria que los enormes modelos densos o los MoE más pesados, como GLM-5.2. Con una cuantización cuidadosa mediante los formatos GGUF dinámicos de Unsloth, la versión de 3 bits se comprime hasta ocupar aproximadamente 103 GB de RAM. Así cruza un umbral decisivo: pone la programación autónoma de nivel de frontera al alcance de desarrolladores individuales con hardware de 128 GB de memoria unificada, en lugar de reservarla para equipos empresariales con clústeres de varias GPU.

Es completamente ciego ante las imágenes y, en las pruebas independientes actuales de inteligencia general, queda por detrás de los lanzamientos Flash más recientes de GLM y Qwen. Para su caso de uso previsto —un agente económico de texto y código en un sistema de la categoría de 128 GB— sigue siendo potente, pero ya no está solo en la cima.

La licencia MIT, el contexto de 1 millón de tokens y la compatibilidad con DSpark aún convierten a DeepSeek en un valioso modelo de referencia para una IA local eficiente. La diferencia es que ese modelo de referencia ocupa ahora el cuarto estante en lugar del primero: una opción especializada en texto y código para quienes pueden dedicar unos 103 GB y no necesitan visión nativa.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Potencia como agente con una dieta estricta: No es simplemente otro modelo abierto, sino una máquina especializada en tareas de agente. Sus 82.7 puntos en Terminal Bench 2.1 —cerca de Opus 4.8— y 54.4 en DeepSWE demuestran que el postentrenamiento puede liberar un uso de herramientas y un razonamiento de varios pasos propios de la frontera sin inflar el tamaño del modelo base.
  • Una eficiencia de hardware extraordinaria: Con solo 13B parámetros activos de un total de 284B, necesita una fracción del ancho de banda de memoria que requieren sus competidores. Con los GGUF dinámicos de Unsloth, la versión de 3 bits cabe en unos 103 GB de RAM, por lo que puede ejecutarse en MacBooks con 128 GB de memoria unificada. Es una opción realmente accesible para desarrolladores locales con necesidades serias.
  • La libertad de la licencia MIT: DeepSeek mantiene su apuesta por el código abierto mediante una licencia MIT. Puedes descargar los pesos, cuantizarlos y desplegarlos comercialmente sin restricciones. Sin condiciones ocultas ni dependencia de una API: solo potencia local.
  • Un contexto de 1M diseñado para trabajar a gran escala: Flash-0731 conserva la enorme ventana de contexto de 1 millón de tokens de la versión preliminar y está hecho a medida para analizar bases de código completas. También incluye compatibilidad con la decodificación especulativa DSpark, que puede aumentar notablemente el rendimiento al procesar repositorios o archivos de registro gigantescos.

Limitaciones honestas

  • Solo texto y código: Como muchos modelos especializados en programación, carece de visión nativa. No puedes darle capturas de una interfaz o diagramas para que ayude a depurarlos. Si tu flujo de trabajo depende mucho de entradas multimodales, necesitarás un modelo de visión aparte.
  • Su capacidad general ya no está a la cabeza de la frontera: Su puntuación cercana a 50 en el Artificial Analysis Intelligence Index queda por detrás de los modelos Flash más recientes de GLM y Qwen, situados entre la mitad y la parte alta de los 50. DeepSeek sigue siendo un especialista, no el banco de trabajo privado más versátil.
  • Riesgos de una cuantización agresiva: Aunque lograr que una cuantización de 3 bits quepa en 103 GB es asombroso, comprimir con tanta intensidad puede degradar en ocasiones el razonamiento complejo. Tendrás que comprobar si la versión de 3 bits conserva exactamente los comportamientos matizados de agente que exige tu entorno de evaluación.
03

Resumen de Benchmarks

Terminal Bench 2.1 — 82.7

Un salto enorme en el uso de terminales como agente que lo deja a poca distancia de Claude 4.8 Opus (85.0).

DeepSWE — 54.4

Un aumento increíble desde los 7.3 de la versión preliminar, que muestra la enorme eficacia de su postentrenamiento del 31 de julio.

Arquitectura — 284B totales / 13B activos

Un diseño mixture-of-experts muy disperso que reduce los FLOPs y el ancho de banda de memoria, permitiendo un rendimiento sólido con hardware limitado.

AutomationBench Public — 25.1

Casi duplica los 12.9 puntos de GLM-5.2, lo que demuestra su superioridad en la ejecución autónoma de varios pasos.

04

El Veredicto

DeepSeek-V4-Flash-0731 pasa al puesto #4 de IA local / privada con un 9,0. Su cuantización de unos 103 GB, la licencia MIT, el contexto de 1 millón de tokens y su sólido enfoque en texto y terminal siguen convirtiéndolo en una opción atractiva para equipos de 128 GB. Ya no merece que se lo llame «estándar de oro»: Qwen3.8-27B es muchísimo más fácil de ejecutar, GLM-5.3-Flash es más potente y multimodal, y Qwen3.8-Flash-Next activa menos capacidad de cómputo. Elige DeepSeek cuando el trabajo de agente con texto y código importe más que la entrada visual y su cuantización concreta rinda bien en tu entorno de evaluación.

05

Preguntas frecuentes