Когда речь заходит о локальном ИИ, разговор обычно сводится к компромиссам. Можно выбрать огромную модель, которой для запуска нужна серверная ферма, или небольшую модель, которая теряет нить сложной сессии программирования. DeepSeek-V4-Flash-0731 разрушает эту дихотомию.
Flash-0731 вышла 31 июля 2026 года как чистое обновление постобучения и сохранила ту же архитектуру MoE с 284B параметров всего и 13B активных, что и предыдущая предварительная версия. Однако полученный прирост возможностей поразителен. В Terminal Bench 2.1 модель взлетела до 82.7, почти сравнявшись с закрытым тяжеловесом Opus 4.8. В DeepSWE результат вырос со скромных 7.3 до внушительных 54.4. Это показывает, что для агента передового уровня не обязательно иметь триллион параметров: достаточно точно научить очень эффективную модель пользоваться инструментами, работать в терминале и исправлять собственные ошибки.
Секрет Flash-0731 — в разреженности. Поскольку при инференсе активны лишь 13B параметров, ей требуется заметно меньшая пропускная способность памяти, чем огромным плотным моделям или более тяжёлым MoE вроде GLM-5.2. При аккуратном квантовании в динамические форматы GGUF от Unsloth трёхбитная версия ужимается примерно до 103 ГБ RAM. Так преодолевается важный порог: автономное программирование передового уровня становится доступно отдельным разработчикам с системой на 128 ГБ объединённой памяти, а не только корпоративным командам с многоускорительными кластерами.
Модель совершенно не видит изображения, а по актуальным независимым тестам общего интеллекта уступает новым выпускам GLM и Qwen Flash. Для своей основной задачи — быть экономичным агентом для текста и кода на системе класса 128 ГБ — она остаётся сильной, но больше не является непревзойдённой.
Лицензия MIT, контекст на 1 миллион токенов и поддержка DSpark по-прежнему делают DeepSeek полезным ориентиром для эффективного локального ИИ. Разница в том, что теперь этот ориентир стоит на четвёртой полке, а не на первой: это специализированный вариант для работы с текстом и кодом для тех, кто может выделить около 103 ГБ памяти и не нуждается в нативном зрении.