Meta* (запрещена в РФ) представила Muse Spark 1.2 — обновлённую модель для программирования — и открыла бета-доступ к терминальному агенту Muse Code. Новый инструмент умеет изучать крупные репозитории, составлять план изменений, редактировать файлы, запускать команды и проверять полученный результат.
Muse Code работает в macOS и Linux. Его главная особенность — длительные сеансы с сохранением состояния. Все обращения к модели, запуски инструментов, подтверждения пользователя и изменения файлов попадают в локальный журнал. После аварийного завершения агент восстанавливает ход работы и возвращается к месту остановки.
Muse Spark 1.2 стала третьим выпуском семейства за четыре месяца. Первая Muse Spark появилась в апреле 2026 года, версия 1.1 — в июле, а 1.2 вышла 5 августа. Основной упор в обновлении сделан на программирование и автономную работу с инструментами.
Muse Spark 1.2 рассчитана на задачи, которые нельзя свести к генерации одной функции по текстовому описанию. Модель должна разобраться в структуре проекта, найти связанные файлы, предложить изменения, проверить сборку и исправить обнаруженные ошибки.
Разработчики увеличили объём вычислений, выделенных на обучение программированию, и расширили набор учебных сред. В перечень целевых сценариев вошли создание репозиториев целиком, крупные проекты с несколькими этапами и автоматизированные исследования.
Для длинных сеансов используются три механизма:
Планирование разбивает общую задачу на последовательные действия.
Удержание цели помогает модели не потерять исходную задачу после десятков промежуточных операций.
Сжатие контекста сокращает накопившуюся историю, сохраняя сведения, необходимые для дальнейшей работы.
Часть учебных заданий подготовила предыдущая Muse Spark 1.1. Она создавала сложные среды и шаблоны инструкций, а затем проверяла решения новой версии. Meta* (запрещена в РФ) называет эту схему циклом самоулучшения. Независимого исследования влияния такого обучения компания не опубликовала.

Artificial Analysis оценила Muse Spark 1.2 в 54 балла по сводному индексу Intelligence Index. Muse Spark 1.1 получила 51 балл, исходная версия — 43.
Muse Spark 1.2 сравнялась с Grok 4.5, которая также набрала 54 балла. GPT-5.5 xhigh получила 55. Выше расположились Kimi K3 с 57 баллами, GPT-5.6 Sol с 59, Claude Fable 5 с 60 и Claude Opus 5 с 61 баллом.
Сводный индекс включает девять испытаний, связанных с программированием, научными задачами, знаниями, работой в терминале, длинным контекстом и использованием внешних инструментов. Основной прирост пришёлся на автономные задания.
В GDPval-AA v2 рейтинг модели вырос с 1371 до 1631 пункта Elo. Прибавка составила 260 пунктов.
Набор GDPval-AA v2 содержит 220 практических заданий из 44 профессий и девяти отраслей экономики США. Модели готовят документы, таблицы, презентации, схемы и аналитические отчёты. Им доступна командная строка и поиск в интернете. Готовые материалы сравниваются попарно в обезличенном виде, а человеческий уровень закреплён на отметке 1000 Elo.
Muse Spark 1.2 заняла в этом испытании пятое место среди проверенных Artificial Analysis моделей. Claude Opus 5 получила 1852 пункта, GPT-5.6 Sol — 1730, Kimi K3 — 1685.
В испытании τ³-Banking, где проверяется использование инструментов при выполнении банковских операций, показатель вырос с 25% до 27%.
SciCode снизился с 58% до 56%, Humanity’s Last Exam — с 45% до 44%. В физическом испытании CritPt результат поднялся с 15% до 18%.
В публикациях о релизе фигурируют два результата Terminal-Bench 2.1.
Artificial Analysis независимо получила 80% против 78% у Muse Spark 1.1. Эта оценка вошла в состав Intelligence Index.
Meta в собственном испытании связки Muse Spark 1.2 и Muse Code получила 82,9%. Claude Opus 5 с Claude Code набрала 86,7%, GPT-5.6 Terra с Codex — 81,8%, Grok 4.5 с Grok Build — 81,6%, Gemini 3.6 Flash с Antigravity — 78,9%.
Разница объясняется методикой. Meta* (запрещена в РФ) проверяла каждую модель вместе с выбранным для неё агентом. Muse Spark работала через Muse Code, GPT — через Codex, Claude — через Claude Code, Grok — через Grok Build. Результат в такой схеме зависит от самой модели, системных инструкций, набора инструментов и качества управляющей программы.
В Terminal-Bench 2.1 использовались все 89 заданий официального набора. Каждое запускалось пять раз в изолированной облачной среде, после чего вычислялась средняя доля успешных выполнений. Meta предупреждает, что её настройки могли быть недостаточно хорошо приспособлены к сторонним закрытым моделям.
В испытании DeepSWE 1.1 Muse Spark 1.2 получила 59,3%.
Claude Opus 5 с Claude Code показала 65%, GPT-5.6 Terra с Codex — 64,8%, Grok 4.5 с Grok Build — 56,6%. Предыдущая Muse Spark 1.1, работавшая через mini-swe-agent, набрала 53%.
DeepSWE состоит из 113 заданий по 91 репозиторию на TypeScript, Go, Python, JavaScript и Rust. Финальная правка переносится в чистую копию проекта и проходит функциональные и регрессионные проверки. Интернет во время выполнения отключён.
Официальный рейтинг DeepSWE использует один агент mini-swe-agent для всех моделей. Meta* (запрещена в РФ) запускала каждую модель через собственный или выбранный разработчиком инструмент. Эти показатели отражают работу готовых связок, а не чистое качество языковых моделей.
В испытании AA-Omniscience доля ошибочных ответов с выдуманными фактами снизилась с 38% до 28%. Итоговый показатель надёжности вырос с 18 до 22 баллов.
Улучшение связано с изменением поведения модели. Muse Spark 1.2 стала отвечать на 67% вопросов вместо прежних 82%. При нехватке уверенности она чаще отказывается от ответа.
Общая точность при этом снизилась с 41% до 38%. Модель реже выдаёт ложные сведения, но также пропускает больше вопросов, на которые могла бы попытаться ответить.
Такое поведение может оказаться полезным при разработке программ. Отказ от сомнительной правки безопаснее уверенного изменения, которое нарушит сборку или повредит данные. Низкая доля ответов способна мешать в справочных и исследовательских сценариях.
Muse Code построен вокруг основного агента и нескольких асинхронных помощников. Каждый из них может заниматься отдельной частью работы: изучать структуру проекта, проверять зависимости или готовить следующий этап изменений.
Субагенты сохраняются в течение сеанса. Их не требуется создавать заново для каждой подзадачи и повторно снабжать описанием проекта. Они самостоятельно выбирают следующий шаг и решают, когда передать результат основному агенту.
В комплект входят три команды:
/plan составляет план и запрашивает подтверждение перед выполнением;
/grill проверяет план вопросами и ищет слабые места;
/goal ведёт работу до достижения заданной цели.
Журнал событий служит единым источником состояния. В него последовательно записываются вызовы модели, запуски инструментов, разрешения пользователя и правки. После сбоя Muse Code воспроизводит журнал и продолжает работу с зафиксированного этапа.
В демонстрационном испытании Muse Code оптимизировал вычислительные ядра KDA и MLA для графических ускорителей NVIDIA Hopper.
Работа продолжалась до 24 часов и включала свыше тысячи обращений к инструментам. Агент изменял реализацию, компилировал код, измерял производительность и переходил к следующему варианту.
Для KDA исходной точкой служила реализация FLA на Triton. Моделям запретили напрямую подключать готовые сторонние библиотеки. Им требовалось самостоятельно написать и оптимизировать алгоритм.
В опубликованном графике KDA Claude Opus 5 ускорила исходную реализацию на 74%, GPT-5.6 Sol — на 71,2%, Muse Spark 1.2 — на 68,7%, GPT-5.6 Terra — на 65,1%, Gemini 3.6 Flash — на 62,5%.
Стандартная цена Muse Spark 1.2 составляет:
$1,25 за миллион входных токенов;
$4,25 за миллион выходных токенов;
$0,15 за миллион входных токенов, прочитанных из кэша.
Контекстное окно вмещает миллион токенов. Модель принимает текст и изображения, а возвращает текст. Её веса не опубликованы: Muse Spark 1.2 остаётся закрытой моделью.
Artificial Analysis оценила среднюю стоимость одного задания из Intelligence Index в $0,40. У версии 1.1 она составляла $0,29. Причиной стал рост расхода токенов: входных — примерно на 53%, выходных — на 36%. Основная часть увеличения пришлась на GDPval-AA v2.
Поэтому неизменная цена миллиона токенов не гарантирует прежнюю стоимость готовой задачи. Более длительные рассуждения и дополнительные обращения к инструментам увеличивают итоговый счёт.
Meta* (запрещена в РФ) также предложила тариф Contributor:
$0,10 за миллион входных токенов;
$0,20 за миллион выходных токенов.
Входные данные обходятся в 12,5 раза дешевле стандартного тарифа, выходные — в 21,25 раза. Скидка связана с разрешением использовать активность клиента для улучшения продуктов Meta* (запрещена в РФ).
Такой режим подходит для открытых проектов, учебных задач и кода без ограничений на передачу третьим лицам. Закрытые репозитории, коммерческие тайны, персональные данные и материалы под соглашением о неразглашении лучше не отправлять без проверки договора и правил организации.
Точные условия Contributor, ограничения по скорости и перечень доступных стран могут меняться. Страница разработчика Meta открывается только после авторизации, поэтому перед подключением следует проверить условия непосредственно в своей учётной записи.
Muse Spark 1.1 появилась в Meta* (запрещена в РФ) Model API в июле и сначала была доступна разработчикам из США. Для версии 1.2 компания заявила об «расширенном международном доступе». Полного списка стран в открытом анонсе нет.
Формулировка не означает, что API и тариф Contributor работают в любой юрисдикции. Доступность зависит от страны, типа аккаунта и условий конкретного тарифа.
Muse Code устанавливается в macOS и Linux. Поддержка Windows в анонсе не указана.
В основных таблицах Meta* (запрещена в РФ) сравнила Muse Spark 1.2 с Claude Opus 5, GPT-5.6 Terra, Grok 4.5, Gemini 3.6 Flash и Kimi K3. GPT-5.6 Sol и Claude Fable 5 в методологии Terminal-Bench и DeepSWE отсутствуют.
Участники Hacker News обратили внимание, что более производительная GPT-5.6 Sol не вошла в главные таблицы, но появилась в отдельном графике оптимизации KDA. В этом графике Sol опередила Muse Spark 1.2.
В июле Business Insider сообщил о следующей крупной модели Meta* (запрещена в РФ) под внутренним названием Watermelon. Издание ссылалось на участников внутренней встречи, где Александр Ван рассказал, что обучение модели продолжается и требует примерно на порядок больше вычислений, чем проект Avocado — внутреннее название первой Muse Spark.
Meta* (запрещена в РФ) публично не представила Watermelon, не раскрыла дату выпуска и не опубликовала техническую документацию. В анонсе Muse Spark 1.2 компания лишь отметила, что готовит более мощные модели.
Вопросы и ответы
Что такое Muse Spark 1.2?
Это закрытая модель Meta с контекстным окном на миллион токенов. Обновление ориентировано на программирование, поиск ошибок, анализ репозиториев и длительную работу с инструментами.
Что такое Muse Code?
Muse Code — терминальный агент для macOS и Linux. Он читает файлы проекта, редактирует код, запускает команды, проверяет результат и сохраняет ход работы в локальном журнале.
Может ли Muse Code продолжить задачу после сбоя?
Да. Журнал содержит обращения к модели, запуски инструментов, подтверждения и правки. После перезапуска агент восстанавливает состояние и возвращается к последнему записанному этапу.
Какой результат модели в Terminal-Bench 2.1?
Artificial Analysis получила 80% в независимом испытании. Meta получила 82,9% при запуске модели через Muse Code. Результаты получены в разных средах и напрямую не сопоставляются.
Стала ли модель меньше выдумывать факты?
Доля галлюцинаций в AA-Omniscience снизилась с 38% до 28%. Доля попыток ответить одновременно упала с 82% до 67%, а точность — с 41% до 38%.
Сколько стоит Muse Spark 1.2?
Стандартный тариф составляет $1,25 за миллион входных и $4,25 за миллион выходных токенов. Чтение миллиона токенов из кэша стоит $0,15.
Чем отличается тариф Contributor?
Contributor снижает цену до $0,10 за миллион входных и $0,20 за миллион выходных токенов. Режим предполагает использование активности клиента для улучшения продуктов Meta.
Работает ли Muse Code в Windows?
Поддержка Windows не заявлена. В официальном анонсе указаны macOS и Linux.
Можно ли считать Muse Spark 1.2 конкурентом Claude Opus 5?
В отдельных заданиях модель приблизилась к ведущей группе, но в сводном Intelligence Index Claude Opus 5 набрала 61 балл против 54 у Muse Spark 1.2. В тестах Meta Opus также заняла первое место в Terminal-Bench и DeepSWE.
Есть новость? Станьте автором.
Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.
Читайте также
Codex поставили перед слиянием кода: OpenAI добавила автоматическую проверку PR на уязвимости
OpenAI переделала ChatGPT: бесплатным пользователям дадут безлимитные чаты, а Sol научили отвечать без лишней воды