Немецкий консорциум SOOFI представил базовую языковую модель Soofi S, рассчитанную прежде всего на английский и немецкий языки. В собственном сравнении разработчиков она набрала больше OLMo 3 32B и Apertus 70B по сводным англоязычным и немецкоязычным тестам среди моделей с полностью раскрываемым процессом разработки.

Модель обучили с нуля на инфраструктуре Deutsche Telekom в Мюнхене. В пиковые периоды использовались 512 серверных ускорителей Nvidia B200, объединённых в 64 узла DGX B200. Весь цикл занял около 253 тыс. GPU-часов и прошёл с 24 марта по 13 мая 2026 года.

Доступный на Hugging Face вариант обозначен как закрытая бета-версия и исследовательский промежуточный результат. Репозиторий виден публично, но скачивание файлов требует одобрения. Финальную версию обещают выложить без ограничения доступа под разрешительной лицензией.
Soofi S построена по архитектуре «смесь экспертов», или Mixture of Experts. Внутри находится 31,6 млрд параметров, но при обработке каждого токена задействуется около 3,2 млрд — примерно 3,6 млрд с учётом слоя представлений. За счёт этого модель получает большую общую ёмкость, не расходуя вычислительные ресурсы на запуск всей сети при каждом шаге генерации.
Архитектуру взяли у Nvidia Nemotron 3 Nano без принципиальных изменений. Всего в сети 52 слоя:
-
23 слоя Mamba-2;
-
23 слоя со «смесью экспертов»;
-
6 слоёв группового внимания.
В каждом экспертном слое есть 128 маршрутизируемых и два общих эксперта. Для отдельного токена выбираются шесть маршрутизируемых блоков.
Mamba-2 относится к архитектурам пространства состояний. Она обрабатывает последовательность через компактное внутреннее состояние и не хранит полную историю ключей и значений для каждого слоя, как классический Transformer.
Полноценный KV-кеш — память с ключами и значениями механизма внимания — нужен Soofi S только в шести слоях из 52. Разработчики оценивают его прирост примерно в 6 КБ на один токен для каждой активной последовательности. Остальные слои Mamba-2 используют состояние фиксированного размера.
Главным техническим преимуществом Soofi S разработчики называют работу с длинными запросами. У обычного Transformer KV-кеш увеличивается вместе с контекстом. Серверу приходится постоянно считывать всё больше данных из памяти, поэтому генерация замедляется.
В испытании консорциума скорость Soofi S оставалась почти неизменной при увеличении входного контекста с 4 тыс. до 256 тыс. токенов. Измеренный совокупный темп генерации составил около 4,29 тыс. токенов в секунду на GPU в начале диапазона и 4,30 тыс. — при 256 тыс. токенов.
При контексте 40 тыс. токенов и пакете из 32 одновременных запросов модель показала 4,82 тыс. токенов в секунду на одном B200. Веса и состояния всех 32 последовательностей при этом помещались в память одного ускорителя.
Обучение разделили на три этапа. В основной фазе модель обработала 20 трлн токенов из смеси веб-страниц, научных материалов, программного кода, математических задач, синтетических данных и немецких текстов.
На этапе повышения качества добавили ещё 6,58 трлн токенов. Последняя фаза использовала около 100 млрд токенов и расширила рабочий контекст до 1 048 576 токенов. Точное количество данных, фактически пройденных оптимизатором, составило 26,68 трлн, поэтому разработчики округляют его до 27 трлн.
Доля немецкого языка была намеренно увеличена по сравнению с исходным рецептом Nemotron. Проект ориентирован на глубокую работу с двумя языками, а не на поверхностную поддержку десятков языков. Разработчики публикуют состав смеси по отдельным источникам, количество повторов и число токенов на каждом этапе.
Часть корпуса состоит из коммерчески лицензированных материалов. Сами данные нельзя выложить свободно, но консорциум обещает раскрыть их статистику и точную долю в обучающей смеси. Для доступных источников выпускаются сценарии подготовки данных.
Soofi S обучалась в Industrial AI Cloud — промышленном вычислительном облаке Deutsche Telekom. Его запустили в Мюнхене в феврале 2026 года совместно с Nvidia и оператором центров обработки данных Polarise.
Полная инфраструктура облака содержит почти 10 тыс. ускорителей семейства Nvidia Blackwell и обеспечивает производительность до 0,5 экзафлопса. Для обучения Soofi S одновременно задействовали не все мощности, а максимум 512 B200.
Внутри каждого узла восемь ускорителей соединялись через NVLink и NVSwitch пятого поколения. Между 64 узлами данные передавались по сети Nvidia Quantum-2 NDR InfiniBand с отдельным соединением 400 Гбит/с для каждого GPU.
Такая сеть особенно важна для «смеси экспертов». Во время обработки токен может быть направлен на эксперт, расположенный на другом ускорителе. Постоянный обмен между серверами становится одним из главных ограничителей скорости.
Консорциум разделил сравнение на две группы. В первую вошли модели, для которых раскрываются веса и значительная часть процесса создания: Alia 40B, EuroLLM 22B, Apertus 70B и OLMo 3 32B.
Soofi S получила 70,1 балла в сводном английском наборе и 79,1 балла в немецком. OLMo 3 32B набрала 67,3 и 69,2 балла соответственно, Apertus 70B — 62,4 и 72,8. Все модели тестировали одним набором инструментов, подсказок и режимов с несколькими примерами.
Во второй группе Soofi S сравнивали с моделями с открытыми весами, включая Qwen3.5 35B-A3B, Gemma 3 27B, Ministral 3 14B и Nemotron 3 Nano. Здесь немецкая модель уже не заняла первое место по всем сводным показателям: Qwen3.5 получила 74,6 балла на английском и 81,6 на немецком против 70,1 и 79,1 у Soofi S.
На HumanEval модель решила 73,8% задач с первой попытки. Это лучший результат среди моделей в опубликованном сравнении: OLMo 3 получила 63%, Apertus — 30,2%, Qwen3.5 — 67,1%, Nemotron 3 Nano — 72,2%.
Soofi S также лидировала на MBPP и его немецкой версии. На HumanEval-DE она уступила Nemotron 3 Nano, а на более защищённом от попадания тестовых задач в обучающие данные наборе LBPP набрала 31%. OLMo 3 получила 32,1%, Nemotron — 38,1%, Qwen3.5 — 32,4%.
Разработчики отдельно указали области, где Soofi S уступает крупным моделям с открытыми весами.
Самым заметным недостатком стала конкурсная математика на немецком языке. В Minerva MATH-DE модель получила 56 баллов. Qwen3.5 35B-A3B набрала 76,5, Gemma 3 27B — 65,6, а архитектурно идентичная Nemotron 3 Nano — 58,1.
Второй недостаток связан с воспроизведением фактов из общих знаний. В NaturalQuestions Soofi S набрала 79 баллов, немного уступив OLMo 3 и заметнее — Gemma 3 и Qwen3.5. Авторы связывают это с тем, что на один токен активируется около 3 млрд параметров, а часть англоязычного веб-корпуса была заменена немецкими данными. Для практического использования они предлагают подключать поиск по внешним источникам.
Вопросы и ответы
Soofi S уже можно свободно скачать?
Пока нет. Репозиторий на Hugging Face открыт для просмотра, но доступ к файлам требует согласования. Текущая версия обозначена как закрытая бета. Финальный checkpoint обещают выпустить без ограничения доступа.
Сколько параметров у модели?
Всего 31,6 млрд. Для обработки отдельного токена активируется около 3,2 млрд параметров, либо 3,6 млрд с учётом слоя представлений.
На каком оборудовании её обучали?
Использовалось до 512 ускорителей Nvidia B200 в Industrial AI Cloud Deutsche Telekom в Мюнхене. Общие затраты составили около 253 тыс. GPU-часов.
Правда ли, что скорость не падает при длинном контексте?
В тесте разработчиков совокупная скорость генерации оставалась почти неизменной между 4 тыс. и 256 тыс. входных токенов. Это результат специального испытания при 32 параллельных последовательностях, а не гарантия одинаковой скорости во всех приложениях.
Поддерживает ли модель миллион токенов?
Карточка модели заявляет контекст до 1 048 576 токенов. Опубликованные подробные измерения скорости охватывают диапазон до 256 тыс. токенов.
Soofi S лучше Qwen3.5?
Не по всем показателям. Soofi S опередила Qwen3.5 на HumanEval и MBPP, но уступила ей по общему английскому и немецкому результату, сложной математике и части тестов знаний и рассуждений.
Что означает результат 73,8% на HumanEval?
Модель с первой попытки сгенерировала код, прошедший тесты, для 73,8% небольших задач HumanEval. Этот результат не измеряет полноценную разработку крупных программных проектов.
Можно ли использовать Soofi S как чат-бота?
Базовый вариант для этого не предназначен. Он не настроен на диалог и безопасное выполнение инструкций. Для чатов готовится отдельная версия Soofi S Instruct.
Есть новость? Станьте автором.
Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.