10 сентября 2026 года DeepSeek официально выпустила модель DeepSeek V4.1 Flash. Это самый компактный представитель нового поколения архитектуры, который при этом обладает нативной мультимодальной способностью понимания изображений и превосходит флагманские модели, включая V4 Pro, в ряде ключевых тестов.
Новая асимметричная архитектура: малые затраты — высокий интеллект
V4.1 Flash использует MoE-архитектуру на 552 млрд параметров с принципиально новой структурой Causal-Encoder-Decoder. Её главная особенность — асимметрия входа и выхода: при чтении входных данных активируется всего 8 млрд параметров, при генерации ответа — 16 млрд, что значительно дешевле моделей сопоставимого размера.
Модель состоит из 40 слоёв Transformer: первые 20 — причинный энкодер, последние 20 — декодер. Глобальный KV-кэш декодера проецируется напрямую из последнего слоя энкодера, что резко снижает вычислительную нагрузку на этапе prefill.
Кэш сжат до предела, стоимость серьёзно снижена
Новое поколение добилось прорыва в эффективности KV-кэша: по сравнению с предыдущей V4 Flash потребность в HBM снижена в 4 раза, а в SSD — в 8 раз. По данным разработчика, относительно самого первого поколения V1 объём KV-кэша сократился в 437 раз.
Это особенно важно для агентных сценариев, где расходы на попадание в кэш занимают значительную долю, и его сжатие напрямую уменьшает стоимость использования.
Производительность превосходит флагман
В бенчмарках V4.1 Flash обошла по уровню интеллекта V4 Pro. В тесте Terminal-Bench 2.1 новая модель набрала 90.6 против 87.9 у V4 Pro и 82.7 у предыдущей V4-Flash. В более сложном Terminal-Bench 3.0 разрыв стал драматическим: 30.0 против 11.8 и 7.6 соответственно.
В DeepSWE v1.1 (разработка программного обеспечения) результат составил 74.2 против 62.7 у V4 Pro. В рейтинге Codeforces модель достигла 3471 балла, обойдя V4 Pro с 3348. В области кибербезопасности (CyberGym) — 88.1 против 83.3.
Таким образом, в работе с терминалом, генерации кода и кибербезопасности — ключевых сценариях агентов — V4.1 Flash значительно опережает предшественников.
API и цены
V4.1 Flash уже доступна в API DeepSeek: достаточно указать имя модели deepseek-flash. Цены также снижены: в непиковые часы ввод (попадание в кэш) — около 0,0026 евро, промах — около 0,13 евро, вывод — около 0,51 евро. В часы пик цена вдвое выше, в непиковые — вдвое ниже.
Старые V4 Flash и V4 Flash Vision Exp отключены, но ради совместимости старые имена моделей временно перенаправляются на V4.1 Flash.
Что с V4 Pro
По последним данным, в ответ на запросы пользователей DeepSeek решила продолжить предоставлять API V4 Pro после 14 сентября, тарификация остаётся прежней. Ранее планировалось автоматически перенаправлять запросы V4 Pro на V4.1 Flash.
Для читателей, следящих за строительством и 3D-печатью, особенно интересна нативная мультимодальная способность V4.1 Flash: модель может напрямую распознавать строительные чертежи, фотографии оборудования или изображения хода работ, открывая новые возможности для обработки инженерной документации.
Источник: deepseek.com
