Cuando se habla de IA local, la conversación suele girar en torno a las concesiones. O tienes un modelo gigantesco que necesita una granja de servidores para funcionar, o uno pequeño al que le cuesta mantener el contexto durante una sesión de programación compleja. DeepSeek-V4-Flash-0731 rompe esa dicotomía.
Publicado el 31 de julio de 2026 como una actualización exclusivamente de postentrenamiento, Flash-0731 comparte exactamente la misma arquitectura MoE de 284B parámetros totales y 13B activos que su versión preliminar. Sin embargo, las capacidades que esta actualización libera son asombrosas. En Terminal Bench 2.1 se dispara hasta 82.7, casi igualando al peso pesado propietario Opus 4.8. En DeepSWE salta de unos modestos 7.3 a unos dominantes 54.4. Esto demuestra que no hace falta un billón de parámetros para construir un agente de nivel de frontera; basta con enseñar a un modelo muy eficiente a utilizar herramientas, moverse por terminales y recuperarse de sus propios errores.
La magia de Flash-0731 reside en su dispersión. Como durante la inferencia solo se activan 13B parámetros, necesita mucho menos ancho de banda de memoria que los enormes modelos densos o los MoE más pesados, como GLM-5.2. Con una cuantización cuidadosa mediante los formatos GGUF dinámicos de Unsloth, la versión de 3 bits se comprime hasta ocupar aproximadamente 103 GB de RAM. Así cruza un umbral decisivo: pone la programación autónoma de nivel de frontera al alcance de desarrolladores individuales con hardware de 128 GB de memoria unificada, en lugar de reservarla para equipos empresariales con clústeres de varias GPU.
Es completamente ciego ante las imágenes y, en las pruebas independientes actuales de inteligencia general, queda por detrás de los lanzamientos Flash más recientes de GLM y Qwen. Para su caso de uso previsto —un agente económico de texto y código en un sistema de la categoría de 128 GB— sigue siendo potente, pero ya no está solo en la cima.
La licencia MIT, el contexto de 1 millón de tokens y la compatibilidad con DSpark aún convierten a DeepSeek en un valioso modelo de referencia para una IA local eficiente. La diferencia es que ese modelo de referencia ocupa ahora el cuarto estante en lugar del primero: una opción especializada en texto y código para quienes pueden dedicar unos 103 GB y no necesitan visión nativa.