Ad
Искусственный интеллект

Ornith-1.5 выпустила 9B-модель для локального запуска: в отдельных тестах она обходит Qwen3.6-35B

Маша Даровская
By Маша Даровская , IT-редактор и автор
Ornith-1.5 выпустила 9B-модель для локального запуска: в отдельных тестах она обходит Qwen3.6-35B
Обложка © Anonhaven

Команда Ornith опубликовала новое открытое семейство Ornith-1.5 для программирования, рассуждений и работы с инструментами. В линейку вошли три основных варианта: плотная модель на 9 млрд параметров, модель со смесью экспертов Ornith-1.5-35B-A3B и старшая Ornith-1.5-397B. Веса доступны под лицензией MIT.

Самая интересная версия — Ornith-1.5-9B. Это полноценная плотная модель примерно на 9 млрд параметров, которую разработчики позиционируют для локального запуска на одном устройстве. Для смартфонов команда отдельно заявляет сжатый вариант Ornith-1.5-9B-Mobile, рассчитанный на iPhone и Android.

Для обычного локального запуска уже опубликована версия в формате GGUF. Например, вариант Q4_K_M занимает 5,63 ГБ, Q5_K_M — 6,47 ГБ, Q8_0 — 9,53 ГБ. Запуск через llama.cpp, Ollama и ряд других локальных движков описан прямо в карточке модели.

Проверить модель и скачать веса можно прямо на Hugging Face: Ornith-1.5-9B-GGUF — карточка модели и файлы.

Наиболее эффектная часть релиза — результаты Ornith-1.5-9B. В NL2Repo, где модель должна по текстовому описанию работать с полноценными программными репозиториями, Ornith-1.5-9B получила 32,4 балла. У Qwen3.6-35B-A3B — 29,4. В SWE Atlas QnA результат еще заметнее: 20,6 против 15,5. В Humanity's Last Exam при использовании инструментов маленькая Ornith набирает 30,5 против 28,9, а в GPQA Diamond — 86,4 против 86,0.

В Terminal-Bench 2.1 большая Qwen получает 52,5 против 46,2 у Ornith. В SWE-bench Verified — 73,4 против 70,6. В SWE-bench Pro — 49,5 против 47,5, в многоязычной версии SWE-bench — 67,2 против 54,4.

В большинстве проверок работы с инструментами Qwen3.6-35B тоже остается впереди: MCP-Atlas — 62,8 против 54,2, BrowseComp — 62 против 56,4, ClawEval — 68,7 против 66,5.

С Gemma 4-31B результаты для Ornith выглядят сильнее. В Terminal-Bench 2.1 она набирает 46,2 против 42,1, в SWE-bench Verified — 70,6 против 52, в SWE-bench Pro — 47,5 против 35,7. При этом Gemma выигрывает, например, в Toolathlon-Verified — 52,8 против 41,2.

Все показатели Ornith-1.5 опубликованы самой командой проекта. Авторы указывают, что результаты новой модели усреднялись по пяти независимым прогонам. Для ряда тестов применялись дополнительные меры против подглядывания решений: отключали сеть, удаляли историю Git и запрещали доступ к репозиториям с эталонными ответами. Модель вышла совсем недавно, поэтому большого массива независимых проверок пока нет.

Ornith-1.5-35B-A3B устроена иначе. Это модель со смесью экспертов, Mixture of Experts. В полном наборе весов находится около 35–36 млрд параметров, но при обработке каждого токена задействуется только часть сети — примерно 3 млрд параметров. Отсюда обозначение A3B. Такой подход позволяет хранить больше знаний и специализированных блоков, не выполняя вычисления через всю модель на каждом шаге. И здесь результаты уже заметно сильнее Qwen3.6-35B-A3B.

В Terminal-Bench 2.1 — 67,8 против 52,5.

SWE-bench Verified — 79,0 против 73,4.

SWE-bench Pro — 59,6 против 49,5.

NL2Repo — 46,2 против 29,4.

SWE Atlas QnA — 39,8 против 15,5.

MCP-Atlas — 70,2 против 62,8.

В таблице, опубликованной Ornith, 35B-вариант опережает Qwen3.6-35B-A3B во всех приведенных там тестах программирования и агентной работы. Исключения появляются уже при сравнении с другими моделями: например, Qwen3.5-397B оказывается сильнее на отдельных задачах рассуждения и поиска.

Старшая Ornith-1.5-397B тоже использует смесь экспертов и нацелена уже не на мобильные устройства, а на серверную инфраструктуру. В опубликованной таблице модель получает 86,1 балла в Terminal-Bench 2.1. У Claude Opus 4.8 — 85,0, у GLM-5.2 — 81,0, у DeepSeek-V4-Flash-0731 — 82,7.

В SWE-bench Verified результат Ornith составляет 86,0. У Claude Opus 4.8 — 85,8, у Kimi K3 — 86,2.

В SWE-bench Pro картина меняется: Ornith получает 65,1, а Claude Opus — 68.

В DeepSWE — 56 против 59 у Claude и 67,5 у Kimi K3.

В GPQA Diamond — 92,8 против 93,6 у Claude Opus 4.8.

Ornith-1.5 не переписывает собственные веса после каждого запроса пользователя и не начинает самостоятельно обучаться ночью на смартфоне. «Самоулучшение» относится к тренировочному процессу модели. Раннее семейство Ornith уже умело в ходе обучения искать более эффективный способ решения задачи. В Ornith-1.5 команда расширила этот цикл: система теперь участвует еще и в создании собственных учебных задач.

Процесс состоит из трех связанных этапов:

  1. Сначала система получает программную среду или проект и историю уже решенных задач. Затем предлагает новую задачу, которая должна находиться чуть выше текущего уровня возможностей.

  2. После этого формируется специальная схема решения: инструкции, инструменты, способ разбиения проблемы на этапы и механизм проверки результата.

  3. Дальше модель пытается выполнить задачу, а полученный результат используется при обучении с подкреплением.

Система оценивает учебные задания сразу по нескольким критериям: задача должна быть корректной, проверяемой, достаточно новой и находиться около текущей границы возможностей модели.

Разработчики установили целевую вероятность успешного решения примерно на уровне 20%. Если модель начинает слишком легко справляться с созданной задачей, ее ценность для обучения снижается, а генератор должен искать более сложный пример. Получается автоматический учебный план: по мере роста возможностей модели тренировочные задачи тоже становятся сложнее.

Для Ornith-1.5-9B заявлено окно контекста до 262 144 токенов. Это подтверждается и настройками серверного запуска в официальной карточке модели. Разработчики отдельно проверяли расширение контекста через YaRN. При коэффициенте масштабирования 4 эффективное окно можно увеличить примерно до 1 млн токенов.

Такое масштабирование применяется ко всем запросам и может немного ухудшать качество на обычных коротких входных данных. Команда поэтому рекомендует включать его только тогда, когда действительно нужен контекст длиннее штатных 262 тысяч токенов. Для смартфона здесь возникает чисто аппаратное ограничение. Поддержка моделью окна в 256 тысяч токенов еще не означает, что весь этот контекст получится комфортно использовать на любом iPhone или Android-смартфоне. Помимо весов необходимо хранить кэш внимания и другие рабочие данные. Чем длиннее диалог или кодовая база, тем больше требуется памяти.

Разработчики заявляют, что сжатая Ornith-1.5-9B-Mobile предназначена для запуска на iPhone и Android. При этом ссылка на Hugging Face, которая сейчас активно расходится в соцсетях, ведет на обычную GGUF-сборку Ornith-1.5-9B, а не на отдельную модель с названием Mobile.

GGUF удобен для локальной работы через llama.cpp и совместимые приложения. Q4_K_M весит 5,63 ГБ, поэтому сама модель помещается в память современных мощных мобильных устройств, но доступная скорость, длина контекста и стабильность будут зависеть от объема ОЗУ, движка и конкретного смартфона.

У Ornith также появилась отдельная коллекция MLX, рассчитанная на устройства Apple с общей памятью, включая Mac. В основной коллекции опубликованы MLX-варианты 9B и 35B-A3B.

Предыдущее поколение Ornith-1.0-9B действительно было мультимодальным: карточка модели на Hugging Face содержит поддержку изображений и пример запроса с картинкой.

У Ornith-1.5-9B ситуация на момент публикации менее однозначная. Текущая официальная карточка GGUF помечает модель как Text Generation, а опубликованные примеры Ornith-1.5 сосредоточены на тексте, программировании и вызове инструментов. Отдельного подтвержденного примера обработки изображения для 1.5 в документации релиза пока нет.

Ornith-1.5-9B умеет формировать структурированные вызовы функций. В официальном примере модель получает описание функции получения погоды и возвращает стандартный вызов инструмента с аргументами. Серверы vLLM и SGLang могут выдавать такие обращения через поле tool_calls, совместимое с привычными интерфейсами для ИИ-агентов.

Авторы также приводят готовые варианты подключения модели к Ollama, llama.cpp, Pi, Hermes Agent и OpenCode. Именно здесь модель представляет наибольший интерес для локального программирования. Ее можно поднять на собственном компьютере, дать агенту доступ к проекту, терминалу и разрешенным инструментам и работать с кодовой базой без обязательной отправки исходников в облачный сервис.

Есть новость? Станьте автором.

Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.