Ad
Искусственный интеллект

Alibaba открыла веса Qwen3.8 на 2,4 трлн параметров: модель занимает 4,89 ТБ и рассчитана на многодневные задачи

Маша Даровская
By Маша Даровская , IT-редактор и автор
Alibaba открыла веса Qwen3.8 на 2,4 трлн параметров: модель занимает 4,89 ТБ и рассчитана на многодневные задачи
Обложка © Anonhaven

Alibaba открыла веса Qwen3.8-2.4T-A95B — крупнейшей модели нового семейства Qwen3.8. Репозиторий уже доступен на Hugging Face: версия в формате BF16 занимает 4,89 ТБ, содержит 2,4 трлн параметров, а при обработке каждого токена использует около 95 млрд из них. Разработчики предусмотрели запуск через vLLM, SGLang, Transformers и другие системы инференса.

Qwen3.8 примерно в 25 раз крупнее по общему числу параметров, чем количество параметров, реально задействуемых на каждом шаге. Такой разрыв появился благодаря разреженной архитектуре со смесью экспертов — Mixture of Experts, MoE.

Qwen3.8 построена на архитектуре MoE. Модель содержит 512 экспертов, из которых при обработке выбираются десять маршрутизируемых блоков и один общий. Архитектура состоит из 92 слоёв и сочетает обычный механизм внимания с Gated DeltaNet — вариантом линейного внимания для обработки длинных последовательностей.

Такая схема позволяет увеличивать общую ёмкость модели без необходимости прогонять через вычислители все 2,4 трлн параметров при генерации каждого токена.

Есть важная деталь: 95 млрд активных параметров не превращают Qwen3.8 в обычную модель на 95 млрд параметров. Весовые коэффициенты остальных экспертов всё равно входят в модель и должны быть доступны системе во время работы. Поэтому официальный BF16-репозиторий и занимает почти пять терабайт. Hugging Face показывает размер 4,89 ТБ и 213 файлов с фрагментами весов.

Для рабочей станции с одной или двумя обычными видеокартами это явно не типичный сценарий. Модель такого размера рассчитана прежде всего на серверы и распределённую инфраструктуру.

У Qwen3.8-2.4T-A95B с Hugging Face родной размер контекста составляет 262 144 токена. Его можно расширить до 1 010 000 токенов. Эти значения указаны в карточке модели.

У облачной Qwen3.8-Max миллион токенов поддерживается штатно. Qwen Cloud устанавливает предел входа в 991 тысячу токенов без режима рассуждений и 983 тысячи с ним. Максимальный ответ — 131 тысяча токенов, а внутреннее рассуждение может занимать до 262 тысяч.

Облачная Qwen3.8-Max построена на Qwen3.8-2.4T-A95B, но Alibaba добавила к ней возможности, которых нет у опубликованной текстовой модели. Это прямо отмечено в документации разработчиков.

Qwen3.8-Max принимает текст, изображения и видео. У неё штатный контекст в миллион токенов, есть режим работы без развёрнутого рассуждения и встроенные средства для вызова внешних функций, поиска по интернету, извлечения данных из веб-страниц и выполнения кода. Qwen Cloud указывает изображения, текст и видео среди допустимых типов входных данных.

Qwen3.8-2.4T-A95B на Hugging Face — текстовая модель. Она не принимает изображения и видео, а режим рассуждения отключить нельзя. Разработчики отдельно предупреждают об этом в инструкции к API.

Qwen3.8-Max поддерживает вызов функций и встроенные инструменты через облачный интерфейс. Это позволяет агентной системе обращаться к поиску, интерпретатору кода и другим внешним компонентам.

В Qwen Code действительно есть одновременное выполнение независимых операций. С апреля программа автоматически объединяет безопасные операции чтения — например, поиск по нескольким файлам — и запускает их одновременно. Изменяющие данные команды выполняются последовательно, чтобы снизить риск конфликтов.

С результатами тестов у Qwen3.8 действительно всё неплохо, однако абсолютного лидерства во всех дисциплинах нет. В таблице, опубликованной разработчиками вместе с открытой моделью, Qwen3.8-Max получила 86,6 балла в Terminal Bench 2.1. Для GPT-5.6 Sol там указан результат 88,8.

В SWE-bench Pro Qwen3.8-Max набрала 67,7 балла. В той же таблице Claude Opus 4.8 получил 69,2, Claude Fable 5 — 80,0.

Зато в PaperBench Qwen3.8-Max показала 93,0 балла против 90,5 у GPT-5.6 Sol, 88,8 у Fable 5 и 80,3 у Opus 4.8. В IFBench модель получила 82,8, а в финансовой части PRBench — 58,3.

Есть оговорка: значительная часть этой таблицы собрана или пересчитана самой командой Qwen, а условия запуска различаются между тестами.

Независимая пользовательская Arena даёт более понятную картину. В Text Arena от 11 августа Qwen3.8-Max набрала 1491 ± 8 баллов. Alibaba занимала вторую строчку среди лабораторий, а сама Qwen3.8-Max была шестой моделью в общем рейтинге. Результат пока отмечен как предварительный. Лидировала Claude Opus 5 Max с 1507 ± 7 балла.

В категории Code Arena WebDev HTML от 12 августа Qwen3.8-Max находилась на пятом месте с 1628 баллами. GPT-5.6 Sol с Codex-оболочкой шла следом с 1623 баллами, а первые позиции занимали модели Anthropic и Moonshot. Разница между частью результатов укладывается в широкие интервалы неопределённости.

В тесте веб-разработки для брендовых и маркетинговых страниц Qwen3.8-Max занимала третью позицию.

Alibaba разрешает бесплатно использовать, копировать, изменять, распространять, дообучать, размещать и создавать производные версии Qwen3.8. При этом модель выпущена под собственной лицензией Qwen3.8-Max, где есть дополнительные коммерческие условия.

Если коммерческий продукт превышает 100 млн активных пользователей в месяц или $20 млн месячной выручки, название модели требуется заметно показывать в интерфейсе.

Отдельное ограничение действует для бизнеса по предоставлению моделей как сервиса и самостоятельных ИИ-помощников для программирования или офисной работы. Компаниям с совокупной выручкой выше $50 млн за любые последовательные 12 месяцев требуется получить отдельную лицензию Qwen для коммерческого использования такого типа. Внутреннее использование из этого требования исключено при соблюдении условий лицензии. Почти пять терабайт весов нужны далеко не всем. Qwen3.8-Max уже доступна через API Qwen Cloud.

Текущий тариф составляет $2 за миллион входных токенов и $6 за миллион выходных. Вход из неявного кэша стоит $0,25 за миллион токенов. Сервис поддерживает контекст в один миллион токенов.

Qwen3.8-2.4T-A95B — модель с 2,4 трлн параметров, 95 млрд активных параметров, 512 экспертами, родным контекстом 262 тысячи токенов и возможностью расширения примерно до миллиона. Полный BF16-репозиторий занимает 4,89 ТБ.

Её облачный родственник Qwen3.8-Max получает мультимодальность, миллион токенов штатно и набор встроенных инструментов. Alibaba также показала 16-дневный автономный эксперимент по разработке ПО, но этот результат пока остаётся демонстрацией самого производителя.

Есть новость? Станьте автором.

Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.