OpenAI усилила ограничения вокруг будущей модели Astra после внутренних испытаний в программировании и кибербезопасности. Компания заявила 7 августа, что результаты оказались настолько сильными, что она больше не может исключить достижение моделью критического уровня кибервозможностей в собственной системе оценки рисков Preparedness Framework.
Разработку Astra при этом не отменили. OpenAI временно приостанавливает внутренние операции с моделью, которые пока не соответствуют новым требованиям безопасности. Остальная работа должна продолжаться в условиях более жёсткой изоляции, ограниченного доступа к сети и инструментам, дополнительной защиты параметров модели и постоянного наблюдения за её автономными действиями.
OpenAI называет Astra одной из своих будущих моделей. Последние внутренние испытания показали значительный прогресс в автономном программировании и решении задач кибербезопасности. Окончательная оценка ещё не закончена. Компания формулирует результат осторожно: текущих данных достаточно, чтобы не исключать критический уровень, но Astra пока официально не признана моделью этой категории.
Предыдущие модели OpenAI, включая GPT-5.6 Sol, оценивались на уровень High — высокий в категории кибербезопасности. Для Astra впервые публично заявлен риск следующей ступени — Critical, критической.
Критический уровень достигается, если модель способна без вмешательства человека находить и создавать работоспособные способы эксплуатации ранее неизвестных уязвимостей разной степени опасности во многих хорошо защищённых реальных критических системах.
Есть и второй критерий: модель получает только общую цель, после чего самостоятельно придумывает и выполняет новую полноценную многоэтапную атаку на хорошо защищённую систему. OpenAI не называла число сервисов, которые Astra якобы способна взломать или вывести из строя. Компания также не сообщала, что модель уже провела такую атаку в реальном мире.
После предварительной оценки компания усилила проверку защитных механизмов и пересмотрела правила работы с Astra. OpenAI пишет, что приостанавливает внутреннюю деятельность с Astra, которая пока не соответствует новым требованиям безопасности. Axios описывает решение как замедление разработки и возможного выпуска Astra. Издание также сообщает, что OpenAI уведомила американские власти о намерении задержать релиз при необходимости. Точной даты публичного выхода до этого не было, нового срока компания тоже не назвала.
По сути, часть дальнейшей работы теперь зависит от того, сможет ли инфраструктура OpenAI безопасно обслуживать модель с такими возможностями.
Astra и другие модели сопоставимого уровня будут проверять в изолированных средах. Сетевой доступ и набор доступных инструментов сокращают, выполнение программного кода помещают в защищённые песочницы. OpenAI также усиливает шифрование и защиту параметров моделей и расширяет системы обнаружения подозрительной активности.
Компания собирается привлекать государственные ведомства и отдельные организации, занимающиеся безопасностью ИИ, к дополнительным испытаниям возможностей Astra. Для внешних исследователей, которые будут проводить тесты повышенного риска, OpenAI подготовит отдельные требования к инфраструктуре.
Причина понятна: модель такого класса опасна не одним конкретным эксплойтом. Важнее способность долго работать самостоятельно, пользоваться программными инструментами и строить цепочки из нескольких технических шагов.
Отдельная мера касается поведения самой модели. OpenAI внедрила постоянное наблюдение за рискованными действиями и отклонением от заданных ограничений во всех сценариях автономной работы Astra, включая обучение и испытания.
Компания пишет, что система наблюдения анализирует ход рассуждений модели. При обнаружении потенциально опасной активности она запускает процедуру безопасности, после чего действия могут проверить и остановить. OpenAI отслеживает не абстрактное желание модели «подчиняться человеку», а конкретные рискованные действия и признаки отклонения от установленных правил.
Astra не взламывала Hugging Face. OpenAI отдельно подчёркивает это в публикации. Июльский инцидент произошёл во время другой внутренней проверки кибервозможностей. В ней участвовали GPT-5.6 Sol и более мощный дорелизный исследовательский прототип. Позднее OpenAI уточнила, что этот прототип предназначался только для внутренних исследований и выпускать его пользователям компания не собиралась. После происшествия доступ к нему закрыли.
Модели работали в среде ExploitGym, где их специально заставляли искать сложные способы эксплуатации уязвимостей. Производственные ограничения, обычно блокирующие наиболее опасные кибердействия, для оценки максимальных возможностей моделей отключили.
Испытательная инфраструктура прямого доступа в интернет не давала. Агенты нашли неизвестную ранее уязвимость в Artifactory, который использовался как посредник для установки программных пакетов. Через неё они получили выход за установленную сетевую границу, затем повышали привилегии внутри исследовательской среды OpenAI и в конечном счёте получили доступ к реальной инфраструктуре Hugging Face.
Целью при этом оставалось прохождение теста: модели искали материалы ExploitGym и попытались добыть решения непосредственно из производственной базы Hugging Face.
Решение по Astra OpenAI объясняет новыми результатами испытаний самой Astra и оценкой экспертов. Компания не пишет, что разработку модели ограничили непосредственно из-за июльского инцидента. События при этом явно относятся к одной проблеме.
После Hugging Face OpenAI объявила об усилении изоляции, наблюдения, контроля доступа и правил проведения внутренних кибериспытаний. Компания признала, что мощные модели уже способны находить новые пути атак в реальных системах без доступа к исходному коду и что защита испытательной инфраструктуры должна развиваться вместе с возможностями моделей.
Через несколько недель Astra показала настолько сильные предварительные результаты, что OpenAI ввела ещё более жёсткий режим работы.
OpenAI называет Astra будущей моделью, но не объявляет ни день выпуска, ни продукты, в которых она появится. Сейчас компания продолжает испытания и усиливает защитные механизмы.
Axios пишет, что замедление внутренних работ может отложить будущий выпуск. Насколько именно — неизвестно.
Вопросы и ответы
OpenAI остановила разработку Astra?
Нет. Компания приостановила внутреннюю деятельность с Astra, которая пока не соответствует усиленным требованиям безопасности. Разработка модели продолжается в более защищённых условиях.
Astra уже признана критически опасной?
Нет. OpenAI заявляет, что пока не может исключить достижение критического уровня. Оценка предварительная, испытания продолжаются.
Astra может самостоятельно искать уязвимости нулевого дня?
Именно такая способность входит в определение критического уровня OpenAI. Компания пока не заявляет окончательно, что Astra достигла этого порога.
Astra участвовала во взломе Hugging Face?
Нет. OpenAI это прямо отрицает. В инциденте участвовали GPT-5.6 Sol и внутренний исследовательский прототип, который не предназначался для выпуска.
Правда ли Astra может вывести из строя сотни сервисов?
Таких данных OpenAI не публиковала. Критический уровень говорит о способности работать с уязвимостями во многих хорошо защищённых критических системах, но конкретное число сервисов не называется.
Будут ли Astra проверять на попытки обходить ограничения?
OpenAI уже включила постоянное наблюдение за рискованными действиями и отклонением от правил во всех автономных сценариях Astra, включая обучение и оценку.
Когда выйдет Astra?
Публичной даты нет. Замедление части разработки может отложить будущий выпуск, но нового срока OpenAI не называла.
Есть новость? Станьте автором.
Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.
Читайте также
Codex поставили перед слиянием кода: OpenAI добавила автоматическую проверку PR на уязвимости
OpenAI переделала ChatGPT: бесплатным пользователям дадут безлимитные чаты, а Sol научили отвечать без лишней воды