Alibaba обновила флагманскую Qwen3.8-Max спустя месяц после релиза. Новый снапшот Qwen3.8-Max-0902 дополнительно обучили на программировании и совместной работе ИИ-агентов: длительных задачах, использовании нескольких инструментов и работе над проектом от постановки задачи до результата.
Архитектура не изменилась: 2,4 трлн параметров, из которых у базовой открытой модели активируется около 95 млрд на токен, контекстное окно на 1 млн токенов и режим рассуждений. Основной прирост пришелся на код. В таблице Qwen результат TerminalBench 3.0 вырос с 11,3 до 29,0, ProgramBench — с 10,5 до 28,0, DeepSWE 1.1 — с 56,6 до 69,3.
Команда представила обновление 2 сентября в анонсе Qwen. В официальной документации Alibaba Cloud версия фигурирует как qwen3.8-max-0902, или qwen3.8-max-2026-09-02. Компания описывает ее как обновление для сложных программных проектов, долгой автономной разработки и координации нескольких инструментов. Улучшения также заявлены для анализа диаграмм, документов и других мультимодальных данных.
Qwen3.8-Max вышла 2 августа 2026 года. Это модель с архитектурой смеси экспертов — Mixture of Experts, или MoE. Всего у нее 2,4 трлн параметров, но при обработке каждого токена работает лишь часть нейросети.
Именно Qwen3.8-Max-0902 сейчас распространяется как облачный снапшот, отдельных весов версии 0902 компания не публиковала. Но сама 2,4-триллионная линия Qwen3.8 открыта: веса Qwen3.8-2.4T-A95B доступны на Hugging Face.
В карточке модели указано 2,4 трлн параметров всего и около 95 млрд активных. Там же Qwen объясняет, что облачная Max основана на Qwen3.8-2.4T-A95B и получает дополнительные возможности сервиса — в частности, обработку изображений, режим без рассуждений, миллионный контекст и встроенные инструменты. Только конкретный снапшот Max-0902 пока доступен как сервис, а близкая открытая модель с тем же масштабом параметров уже опубликована.
Самый заметный скачок произошел в TerminalBench 3.0 — тестах, где агент работает с командной строкой и должен самостоятельно выполнять многошаговые задачи. Предыдущая Qwen3.8-Max получила 11,3 балла, новая — 29,0. Рост примерно в 2,6 раза.
В ProgramBench показатель увеличился с 10,5 до 28,0, то есть примерно в 2,7 раза. Здесь агенту нужно воспроизвести поведение программы, имея доступ к ее интерфейсу, но не к исходному коду.
DeepSWE 1.1 вырос с 56,6 до 69,3. Этот набор состоит из 113 длительных задач программной инженерии в 91 реальном открытом репозитории на Go, Python, TypeScript, Rust и JavaScript. Проверяется не красивый ответ модели, а результат ее работы с кодом и тестами. В NL2Repo-Bench, где требуется генерировать изменения на уровне целого репозитория, результат поднялся с 55,9 до 64,9. В SWE-Marathon — с 39,1 до 44,8. В опубликованной Qwen сравнительной таблице выросли все основные кодовые показатели относительно августовской Max.

Резкий рост относительно предыдущей Qwen не означает, что модель стала лучшей во всех задачах программирования. В той же таблице Claude Opus 5 набирает 42,7 в TerminalBench 3.0 против 29,0 у Qwen3.8-Max-0902. В DeepSWE 1.1 — 73,6 против 69,3, в NL2Repo-Bench — 72,3 против 64,9, в ProgramBench — 41,5 против 28,0. Разрыв сокращается в очень длинных заданиях. В SWE-Marathon у Opus 5 указано 50,0, у новой Qwen — 44,8.
Здесь результаты важно читать вместе с условиями запуска. DeepSWE, например, оценивает связку модель + агентная оболочка + уровень рассуждений, а не модель в вакууме. На итог могут заметно влиять доступные инструменты, системные инструкции и способ организации работы агента. Публичный рейтинг DeepSWE разделяет такие конфигурации.
Есть область, где картина обратная. В SWE-Atlas QnA Qwen3.8-Max-0902 получила 66,3. В сравнительной таблице производителя у Opus 5 — 63,2, у GPT-5.6 Sol — 46,0, у Fable 5 — 39,0. SWE-Atlas QnA проверяет глубокое понимание существующей кодовой базы. Агент исследует реальные проекты, прослеживает выполнение программы через несколько файлов, разбирается в архитектуре и отвечает на технические вопросы. В наборе 124 задания по 11 репозиториям на Go, Python, C и TypeScript. В QwenSWEBench V2 новая версия получила 70,0 против 55,1 у предыдущей Max. В таблице Qwen это также больше 68,0 у Opus 5 и 67,1 у Fable 5.
Вторая специализация обновления — то, что Qwen называет Cowork: длительная работа с приложениями, файлами и инструментами вместо одного запроса и одного ответа. В CoWorkBench новая Max получила 76,1 против 74,8 у предыдущей версии — прирост небольшой. В JobBench показатель вырос гораздо заметнее: с 53,4 до 64,0.
В Automation Bench 1.0.6 Qwen получила 50,8. В опубликованной таблице это немного выше 50,3 у Opus 5. В Toolathlon Verified ситуация обратная: Qwen набрала 73,3, Opus 5 — 77,6, Fable 5 — 77,9, GPT-5.6 Sol — 74,9. В экспертной оценке WorkArena результат Qwen вырос с 1348 до 1468 Elo. В таблице производителя это выше Opus 5 с 1437 и немного ниже GPT-5.6 Sol с 1482.
Независимое подтверждение роста появилось в Code Arena: WebDev, где модели оценивают на задачах веб-разработки, включая многошаговую работу с инструментами. Сначала Qwen3.8-Max-0902 дебютировала на первом месте с результатом около 1691 балла. Arena отдельно сообщила, что новый снапшот опередил Opus 5 Max и предыдущую Qwen3.8-Max.
Но рейтинг быстро меняется. На момент проверки 2 сентября первое место в общем зачете занимает новая Claude Fable 5.1 Max с 1765 баллами. Qwen3.8-Max-0902 находится второй с 1688, Claude Opus 5 Max — третьей с 1687.
Разница между Qwen и Opus здесь статистически незначительна: у Qwen указан интервал ±18 баллов, у Opus — ±8. Результат Qwen еще помечен как Preliminary и основан примерно на 1,5 тыс. голосов, у Opus их уже больше 10 тыс. При этом старая Qwen3.8-Max находится примерно на отметке 1669, поэтому прирост новой версии заметен и здесь.
Qwen3.8-Max-0902 поддерживает текст, изображения и видео на входе и выдает текст. Общий объем контекста составляет 1 млн токенов. Alibaba указывает максимум 991 808 входных токенов в обычном режиме и 983 616 при включенных рассуждениях. Максимальный ответ — 131 072 токена, лимит внутренней цепочки рассуждений — 262 144 токена. В мультимодальных тестах прирост оказался намного скромнее, чем в коде. MMMU-Pro вырос с 82,3 до 82,7, ERQA — с 77,8 до 78,3, ClawEval-MM — с 77,2 до 80,2, BabyVision — с 91,3 до 93,8 в таблице релиза.
На международной площадке QwenCloud цена составляет $2 за 1 млн входных токенов и $6 за 1 млн выходных. Повторяющийся контекст дешевле: автоматическое попадание во внутренний кэш стоит $0,25 за миллион токенов, чтение из явно созданного кэша — $0,17, а его создание — $2,50.
Для программных агентов кэш особенно важен. Большой репозиторий, инструкции и документация могут передаваться модели много раз в течение одной задачи, поэтому стоимость повторного контекста способна заметно влиять на итоговый счет.
При этом тариф $2/$6 действует не во всех регионах Alibaba Cloud. В Сингапуре, который компания помечает как международный регион, указаны именно эти цены. Во Франкфурте, Вирджинии, Токио и Гонконге базовый тариф сейчас составляет $1,65 за миллион входных и $4,951 за миллион выходных токенов. Поэтому при расчете расходов на API нужно учитывать конкретный регион развертывания, а не одну глобальную цену.
Модель уже доступна на странице Qwen3.8-Max-0902 в QwenCloud.
Вопросы и ответы
Что такое Qwen3.8-Max-0902?
Это снапшот Qwen3.8-Max от 2 сентября 2026 года. Он сохранил архитектуру, миллионный контекст и режим рассуждений, но получил дополнительное обучение на программировании, работе с инструментами и длительных агентных задачах.
У Qwen3.8-Max-0902 открыты веса?
Отдельные веса версии 0902 пока не опубликованы. При этом открытая Qwen3.8-2.4T-A95B с 2,4 трлн параметров доступна для самостоятельного запуска.
Насколько новая версия стала лучше в коде?
Самый большой прирост виден в TerminalBench 3.0 — с 11,3 до 29,0 — и ProgramBench — с 10,5 до 28,0. DeepSWE 1.1 вырос с 56,6 до 69,3.
Qwen3.8-Max-0902 лучше Claude Opus 5?
Зависит от задачи. Qwen выше в отдельных тестах понимания репозитория и собственных оценках Alibaba, но Opus 5 остается впереди в TerminalBench, DeepSWE, NL2Repo-Bench и ProgramBench.
Qwen сейчас первая в Code Arena?
Нет. На момент проверки 2 сентября первое место в Code Arena: WebDev занимает Claude Fable 5.1 Max. Qwen3.8-Max-0902 идет второй и практически делит позицию с Claude Opus 5 Max с учетом статистической погрешности.
Сколько стоит Qwen3.8-Max-0902?
В международном QwenCloud — $2 за миллион входных и $6 за миллион выходных токенов. Попадание во внутренний кэш стоит $0,25, чтение из явно созданного кэша — $0,17 за миллион токенов. В других регионах Alibaba Cloud тариф отличается.
Есть новость? Станьте автором.
Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.