DeepSeek выпустила V4.1 Flash — новую мультимодальную модель с архитектурой «смеси экспертов», рассчитанную прежде всего на длинный контекст, программирование и работу ИИ-агентов. В тестах, опубликованных самой DeepSeek, модель обошла GPT-5.6 Sol и Claude Opus 5 в нескольких задачах для программных агентов. Универсальным лидером V4.1 Flash при этом не стала: в части испытаний на рассуждение, работу в терминале и информационную безопасность модели OpenAI и Anthropic остаются впереди.
Релиз состоялся 10 сентября после короткого тестирования предварительной версии, которая появилась в API двумя днями ранее. Финальная V4.1 Flash уже доступна через API DeepSeek под идентификатором deepseek-flash, а компания опубликовала веса модели для самостоятельного развертывания.
DeepSeek V4.1 Flash построена на новой архитектуре Causal Encoder-Decoder, или причинного кодировщика-декодировщика. Ее основная нейросеть содержит 552 млрд параметров. Дополнительно используется механизм Engram объемом 196 млрд параметров для хранения и быстрого извлечения информации.
Из всех параметров при обработке входного текста задействуется около 8 млрд на токен, а при генерации ответа — около 16 млрд. Такая асимметричная схема особенно важна для ИИ-агентов: они могут многократно передавать модели большие объемы кода, истории работы и результатов вызова инструментов, поэтому стоимость обработки входного контекста быстро становится значительной.
Контекстное окно достигает 1 млн токенов. V4.1 Flash также изначально умеет работать с изображениями, поэтому отдельная экспериментальная версия V4 Flash Vision больше не нужна. Через совместимые API-сервисы для модели заявлен предел генерации до 384 тыс. токенов.
Модель предварительно обучили на мультимодальном массиве объемом 45 трлн токенов, затем дополнительно обучали на задачах рассуждения, программирования и работы с инструментами.
Один из самых заметных результатов DeepSeek приводит для DeepSWE v1.1 — теста программных агентов на длинных задачах из реальных по структуре проектов.
В таблице DeepSeek V4.1 Flash получила 74,2%, Claude Opus 5 — 74,0%, GPT-5.6 Sol — 73,0%. Разница между DeepSeek и Opus 5 составляет всего 0,2 процентного пункта.
Здесь есть существенная оговорка. На момент релиза V4.1 Flash еще отсутствует в официальной таблице DeepSWE. Последнее обновление рейтинга датировано 3 сентября. В нем Claude Opus 5 показывает 74% с погрешностью ±4 процентных пункта, а GPT-5.6 Sol — 73% ±3 процентных пункта. Разработчики теста отдельно отмечают, что результаты ведущих моделей расположены очень близко и их интервалы часто пересекаются. Поэтому 74,2% V4.1 Flash пока стоит считать результатом тестирования DeepSeek, а не независимой оценкой авторов DeepSWE.
Все модели в официальном рейтинге DeepSWE запускаются через одну оболочку mini-swe-agent. Сам тест включает 113 задач из 91 репозитория на пяти языках программирования.
Еще один сильный результат разработчик приводит для CyberGym — набора задач, связанных с поиском и использованием уязвимостей в программном обеспечении.
V4.1 Flash набрала 88,1%, GPT-5.6 Sol — 84,5%. В опубликованной DeepSeek таблице GLM-5.3 также получила 84,5%, Kimi K3 — 80%.
При этом по другим тестам информационной безопасности результаты меняются. В SEC-Bench Pro у V4.1 Flash указано 62,8%, а в ExploitGym — 15,3%.
Особенно сильной новая DeepSeek выглядит в тестах, где агенту приходится выполнять цепочку действий и пользоваться внешними инструментами.
В AutomationBench V4.1 Flash получила 54,8%. В сравнительной таблице DeepSeek у Claude Opus 5 — 50,3%, GLM-5.3 — 48,8%, Kimi K3 — 46,7%, GPT-5.6 Sol — 45,8%.
В Terminal-Bench 2.1 результат DeepSeek составляет 90,6%. Однако преимущество исчезает на новых версиях того же теста: в Terminal-Bench 3.0 V4.1 Flash получила 30,0%, GPT-5.6 Sol — 34,4%, Claude Opus 5 — 43,3%. Для Terminal-Bench 4.0 DeepSeek заявляет 31,2% для своей модели.
На тестах, где основной упор сделан на знания и сложные рассуждения, V4.1 Flash уже не занимает первое место.
В GPQA Diamond DeepSeek получила 90,9%. Для Humanity's Last Exam без инструментов результат составляет 36,8%. В ZeroBench с инструментами — 49,0%.
В опубликованном DeepSeek сравнении GPT-5.6 Sol набирает 94,1% на GPQA Diamond, а Claude Opus 5 — 93,4%. На Humanity's Last Exam у Opus 5 указано 56,3% против 36,8% у V4.1 Flash.
Одно из главных архитектурных изменений V4.1 Flash связано с KV-кешем — областью памяти, в которой модель сохраняет промежуточные данные уже обработанных токенов. Без такого кеша ей пришлось бы заново пересчитывать весь предыдущий контекст при генерации каждого нового фрагмента ответа.
У V4.1 Flash объем KV-кеша составляет около 890 байт на токен. У предыдущей V4 Flash показатель достигал примерно 3514 байт. Таким образом, новую версию удалось сделать почти в четыре раза экономнее по этому параметру. Объем данных, которые требуется постоянно хранить для повторного использования кеша, разработчик сократил еще сильнее — примерно в восемь раз.
В архитектуре используется Compressed Sparse Attention 2 — новый вариант разреженного внимания. Вместо одинаково дорогой обработки всего доступного контекста система может выбирать наиболее значимые его части. Для долговременного хранения кеша применяется механизм SWA Bounded Replay: часть промежуточных состояний можно повторно вычислить при необходимости вместо постоянного хранения. Эта оптимизация рассчитана прежде всего на длительные агентные задачи, где история одного запуска может достигать сотен тысяч токенов.
Цена $0,15 за миллион входных и $0,60 за миллион выходных токенов действительно действует, но только в льготные часы.
DeepSeek использует два тарифа. Вне часов пик миллион входных токенов без попадания в кеш стоит $0,15, кешированный ввод — $0,003, вывод — $0,60. В часы пик цены удваиваются: $0,30, $0,006 и $1,20 соответственно. Пиковыми считаются промежутки с 01:00 до 04:00 и с 06:00 до 10:00 UTC по будням.
Для сравнения, GPT-5.6 Sol сейчас стоит $4 за миллион входных токенов, $0,40 за кешированный ввод и $20 за миллион выходных. У Sol это временная сниженная цена, которая заявлена как минимум до 21 ноября 2026 года. Контекст модели составляет 1,05 млн токенов, максимальный вывод — 128 тыс. токенов.
Прямое сравнение тарифов при этом не показывает конечную стоимость выполнения агентной задачи. Две модели могут использовать разное количество токенов, делать разное число шагов и по-разному часто обращаться к инструментам.
С релизом изменилась и линейка моделей DeepSeek. V4.1 Flash теперь вызывается через deepseek-flash. Прежние V4 Flash и V4 Flash Vision Exp выведены из актуальной линейки, хотя их старые идентификаторы пока сохраняются для совместимости и перенаправляются на V4.1 Flash.
Еще заметнее изменение затронет V4 Pro. После 12:00 по пекинскому времени 14 сентября все обращения к deepseek-v4-pro планируется перенаправлять на V4.1 Flash и тарифицировать по цене Flash. Такой режим должен действовать до выпуска V4.1 Pro.
DeepSeek объясняет решение результатами внутренних и внешних тестов: компания считает, что новая Flash превосходит V4 Pro по совокупности качества, стоимости, скорости и времени выполнения задач.
Одновременно с API-релизом DeepSeek опубликовала веса V4.1 Flash на Hugging Face и заявила поддержку сообщества, которое занимается адаптацией систем вывода для новой архитектуры. Модель распространяется с открытыми весами, что позволяет разворачивать ее в собственной инфраструктуре.
При этом слово Flash не означает, что модель небольшая. Только основная нейросеть насчитывает 552 млрд параметров, к которым добавляется 196 млрд параметров Engram. Малой ее делает число параметров, задействованных при обработке одного токена, — 8 млрд на входе и 16 млрд при генерации. Для локального запуска полных весов все равно требуется серверное оборудование с очень большим объемом памяти и хранилища.
Вопросы и ответы
DeepSeek V4.1 Flash действительно лучше GPT-5.6 Sol?
В отдельных агентных тестах — да. В таблице DeepSeek V4.1 Flash выше GPT-5.6 Sol на DeepSWE v1.1, CyberGym и AutomationBench. В GPQA Diamond, Terminal-Bench 3.0 и некоторых тестах информационной безопасности Sol остается впереди.
Сколько параметров у DeepSeek V4.1 Flash?
Основная нейросеть содержит 552 млрд параметров. Отдельно модель использует 196 млрд параметров Engram. При обработке входного контекста активируется около 8 млрд параметров на токен, при генерации — около 16 млрд.
Что означает результат 74,2% на DeepSWE?
Это результат V4.1 Flash, опубликованный DeepSeek. В официальном рейтинге DeepSWE новая модель на 10 сентября еще не появилась. Claude Opus 5 там имеет 74% ±4 процентных пункта, GPT-5.6 Sol — 73% ±3.
V4.1 Flash действительно обошла Claude Opus 5 на DeepSWE?
В тестировании DeepSeek — на 0,2 процентного пункта: 74,2% против 74,0%. Такая небольшая разница сама по себе не доказывает устойчивого превосходства одной модели над другой.
Сколько стоит DeepSeek V4.1 Flash?
Вне часов пик API стоит $0,15 за миллион входных токенов без попадания в кеш, $0,003 за кешированный ввод и $0,60 за миллион выходных. В часы пик тарифы составляют $0,30, $0,006 и $1,20 соответственно.
Работает ли V4.1 Flash с изображениями?
Да. Мультимодальность встроена в новую архитектуру: модель принимает текст и изображения.
Можно ли развернуть V4.1 Flash самостоятельно?
Да. DeepSeek опубликовала веса модели на Hugging Face. Однако полная модель очень крупная и рассчитана прежде всего на серверную инфраструктуру.
Есть новость? Станьте автором.
Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.


