Ad
Искусственный интеллект

DeepSeek V4.1 Flash обошла флагманы в агентных тестах

Маша Даровская
By Маша Даровская , IT-редактор и автор
DeepSeek V4.1 Flash обошла флагманы в агентных тестах
Обложка © Anonhaven

DeepSeek выпустила V4.1 Flash — новую мультимодальную модель с архитектурой «смеси экспертов», рассчитанную прежде всего на длинный контекст, программирование и работу ИИ-агентов. В тестах, опубликованных самой DeepSeek, модель обошла GPT-5.6 Sol и Claude Opus 5 в нескольких задачах для программных агентов. Универсальным лидером V4.1 Flash при этом не стала: в части испытаний на рассуждение, работу в терминале и информационную безопасность модели OpenAI и Anthropic остаются впереди.

Релиз состоялся 10 сентября после короткого тестирования предварительной версии, которая появилась в API двумя днями ранее. Финальная V4.1 Flash уже доступна через API DeepSeek под идентификатором deepseek-flash, а компания опубликовала веса модели для самостоятельного развертывания.

DeepSeek V4.1 Flash построена на новой архитектуре Causal Encoder-Decoder, или причинного кодировщика-декодировщика. Ее основная нейросеть содержит 552 млрд параметров. Дополнительно используется механизм Engram объемом 196 млрд параметров для хранения и быстрого извлечения информации.

Из всех параметров при обработке входного текста задействуется около 8 млрд на токен, а при генерации ответа — около 16 млрд. Такая асимметричная схема особенно важна для ИИ-агентов: они могут многократно передавать модели большие объемы кода, истории работы и результатов вызова инструментов, поэтому стоимость обработки входного контекста быстро становится значительной.

Контекстное окно достигает 1 млн токенов. V4.1 Flash также изначально умеет работать с изображениями, поэтому отдельная экспериментальная версия V4 Flash Vision больше не нужна. Через совместимые API-сервисы для модели заявлен предел генерации до 384 тыс. токенов.

Модель предварительно обучили на мультимодальном массиве объемом 45 трлн токенов, затем дополнительно обучали на задачах рассуждения, программирования и работы с инструментами.

Один из самых заметных результатов DeepSeek приводит для DeepSWE v1.1 — теста программных агентов на длинных задачах из реальных по структуре проектов.

В таблице DeepSeek V4.1 Flash получила 74,2%, Claude Opus 5 — 74,0%, GPT-5.6 Sol — 73,0%. Разница между DeepSeek и Opus 5 составляет всего 0,2 процентного пункта.

Здесь есть существенная оговорка. На момент релиза V4.1 Flash еще отсутствует в официальной таблице DeepSWE. Последнее обновление рейтинга датировано 3 сентября. В нем Claude Opus 5 показывает 74% с погрешностью ±4 процентных пункта, а GPT-5.6 Sol — 73% ±3 процентных пункта. Разработчики теста отдельно отмечают, что результаты ведущих моделей расположены очень близко и их интервалы часто пересекаются. Поэтому 74,2% V4.1 Flash пока стоит считать результатом тестирования DeepSeek, а не независимой оценкой авторов DeepSWE.

Все модели в официальном рейтинге DeepSWE запускаются через одну оболочку mini-swe-agent. Сам тест включает 113 задач из 91 репозитория на пяти языках программирования.

Еще один сильный результат разработчик приводит для CyberGym — набора задач, связанных с поиском и использованием уязвимостей в программном обеспечении.

V4.1 Flash набрала 88,1%, GPT-5.6 Sol — 84,5%. В опубликованной DeepSeek таблице GLM-5.3 также получила 84,5%, Kimi K3 — 80%.

При этом по другим тестам информационной безопасности результаты меняются. В SEC-Bench Pro у V4.1 Flash указано 62,8%, а в ExploitGym — 15,3%.

Особенно сильной новая DeepSeek выглядит в тестах, где агенту приходится выполнять цепочку действий и пользоваться внешними инструментами.

В AutomationBench V4.1 Flash получила 54,8%. В сравнительной таблице DeepSeek у Claude Opus 5 — 50,3%, GLM-5.3 — 48,8%, Kimi K3 — 46,7%, GPT-5.6 Sol — 45,8%.

В Terminal-Bench 2.1 результат DeepSeek составляет 90,6%. Однако преимущество исчезает на новых версиях того же теста: в Terminal-Bench 3.0 V4.1 Flash получила 30,0%, GPT-5.6 Sol — 34,4%, Claude Opus 5 — 43,3%. Для Terminal-Bench 4.0 DeepSeek заявляет 31,2% для своей модели.

На тестах, где основной упор сделан на знания и сложные рассуждения, V4.1 Flash уже не занимает первое место.

В GPQA Diamond DeepSeek получила 90,9%. Для Humanity's Last Exam без инструментов результат составляет 36,8%. В ZeroBench с инструментами — 49,0%.

В опубликованном DeepSeek сравнении GPT-5.6 Sol набирает 94,1% на GPQA Diamond, а Claude Opus 5 — 93,4%. На Humanity's Last Exam у Opus 5 указано 56,3% против 36,8% у V4.1 Flash.

Одно из главных архитектурных изменений V4.1 Flash связано с KV-кешем — областью памяти, в которой модель сохраняет промежуточные данные уже обработанных токенов. Без такого кеша ей пришлось бы заново пересчитывать весь предыдущий контекст при генерации каждого нового фрагмента ответа.

У V4.1 Flash объем KV-кеша составляет около 890 байт на токен. У предыдущей V4 Flash показатель достигал примерно 3514 байт. Таким образом, новую версию удалось сделать почти в четыре раза экономнее по этому параметру. Объем данных, которые требуется постоянно хранить для повторного использования кеша, разработчик сократил еще сильнее — примерно в восемь раз.

В архитектуре используется Compressed Sparse Attention 2 — новый вариант разреженного внимания. Вместо одинаково дорогой обработки всего доступного контекста система может выбирать наиболее значимые его части. Для долговременного хранения кеша применяется механизм SWA Bounded Replay: часть промежуточных состояний можно повторно вычислить при необходимости вместо постоянного хранения. Эта оптимизация рассчитана прежде всего на длительные агентные задачи, где история одного запуска может достигать сотен тысяч токенов.

Цена $0,15 за миллион входных и $0,60 за миллион выходных токенов действительно действует, но только в льготные часы.

DeepSeek использует два тарифа. Вне часов пик миллион входных токенов без попадания в кеш стоит $0,15, кешированный ввод — $0,003, вывод — $0,60. В часы пик цены удваиваются: $0,30, $0,006 и $1,20 соответственно. Пиковыми считаются промежутки с 01:00 до 04:00 и с 06:00 до 10:00 UTC по будням.

Для сравнения, GPT-5.6 Sol сейчас стоит $4 за миллион входных токенов, $0,40 за кешированный ввод и $20 за миллион выходных. У Sol это временная сниженная цена, которая заявлена как минимум до 21 ноября 2026 года. Контекст модели составляет 1,05 млн токенов, максимальный вывод — 128 тыс. токенов.

Прямое сравнение тарифов при этом не показывает конечную стоимость выполнения агентной задачи. Две модели могут использовать разное количество токенов, делать разное число шагов и по-разному часто обращаться к инструментам.

С релизом изменилась и линейка моделей DeepSeek. V4.1 Flash теперь вызывается через deepseek-flash. Прежние V4 Flash и V4 Flash Vision Exp выведены из актуальной линейки, хотя их старые идентификаторы пока сохраняются для совместимости и перенаправляются на V4.1 Flash.

Еще заметнее изменение затронет V4 Pro. После 12:00 по пекинскому времени 14 сентября все обращения к deepseek-v4-pro планируется перенаправлять на V4.1 Flash и тарифицировать по цене Flash. Такой режим должен действовать до выпуска V4.1 Pro.

DeepSeek объясняет решение результатами внутренних и внешних тестов: компания считает, что новая Flash превосходит V4 Pro по совокупности качества, стоимости, скорости и времени выполнения задач. 

Одновременно с API-релизом DeepSeek опубликовала веса V4.1 Flash на Hugging Face и заявила поддержку сообщества, которое занимается адаптацией систем вывода для новой архитектуры. Модель распространяется с открытыми весами, что позволяет разворачивать ее в собственной инфраструктуре.

При этом слово Flash не означает, что модель небольшая. Только основная нейросеть насчитывает 552 млрд параметров, к которым добавляется 196 млрд параметров Engram. Малой ее делает число параметров, задействованных при обработке одного токена, — 8 млрд на входе и 16 млрд при генерации. Для локального запуска полных весов все равно требуется серверное оборудование с очень большим объемом памяти и хранилища.

Вопросы и ответы

DeepSeek V4.1 Flash действительно лучше GPT-5.6 Sol?

В отдельных агентных тестах — да. В таблице DeepSeek V4.1 Flash выше GPT-5.6 Sol на DeepSWE v1.1, CyberGym и AutomationBench. В GPQA Diamond, Terminal-Bench 3.0 и некоторых тестах информационной безопасности Sol остается впереди.

Сколько параметров у DeepSeek V4.1 Flash?

Основная нейросеть содержит 552 млрд параметров. Отдельно модель использует 196 млрд параметров Engram. При обработке входного контекста активируется около 8 млрд параметров на токен, при генерации — около 16 млрд.

Что означает результат 74,2% на DeepSWE?

Это результат V4.1 Flash, опубликованный DeepSeek. В официальном рейтинге DeepSWE новая модель на 10 сентября еще не появилась. Claude Opus 5 там имеет 74% ±4 процентных пункта, GPT-5.6 Sol — 73% ±3.

V4.1 Flash действительно обошла Claude Opus 5 на DeepSWE?

В тестировании DeepSeek — на 0,2 процентного пункта: 74,2% против 74,0%. Такая небольшая разница сама по себе не доказывает устойчивого превосходства одной модели над другой.

Сколько стоит DeepSeek V4.1 Flash?

Вне часов пик API стоит $0,15 за миллион входных токенов без попадания в кеш, $0,003 за кешированный ввод и $0,60 за миллион выходных. В часы пик тарифы составляют $0,30, $0,006 и $1,20 соответственно.

Работает ли V4.1 Flash с изображениями?

Да. Мультимодальность встроена в новую архитектуру: модель принимает текст и изображения.

Можно ли развернуть V4.1 Flash самостоятельно?

Да. DeepSeek опубликовала веса модели на Hugging Face. Однако полная модель очень крупная и рассчитана прежде всего на серверную инфраструктуру.

Есть новость? Станьте автором.

Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.