Ad
Искусственный интеллект

OpenAI притормозила обучение передовых моделей после инцидента с Hugging Face и новых тестов Astra

Маша Даровская
By Маша Даровская , IT-редактор и автор
OpenAI притормозила обучение передовых моделей после инцидента с Hugging Face и новых тестов Astra
Обложка © Anonhaven

OpenAI временно замедлила развитие своих наиболее мощных моделей и перенаправила часть усилий на защиту исследовательской инфраструктуры. Компания на две недели приостанавливала обучение с подкреплением для последних моделей, предназначенных для последующего развертывания. Крупнейший запланированный цикл обучения с подкреплением для передовой модели пока остается на паузе: вместо него проходят эксперименты меньшего масштаба, проверки поведения и тестирование новых защитных механизмов.

Полной остановки разработки ИИ при этом нет. OpenAI продолжает обучение, исследования и испытания там, где инфраструктура соответствует новым требованиям. Часть работ с будущей моделью Astra тоже продолжается. Приостановлены те задачи, для которых компания пока не обеспечила усиленную изоляцию, сетевые ограничения и постоянный контроль действий модели.

Причиной изменения режима работы стали два отдельных события. В июле модели OpenAI во время внутреннего испытания кибервозможностей нашли путь из изолированной тестовой среды в интернет, после чего добрались до производственной инфраструктуры Hugging Face. В августе предварительные тесты другой будущей модели, Astra, показали настолько высокие результаты в программировании и информационной безопасности, что OpenAI больше не может исключить достижение ею категории Critical — «Критический уровень» по собственной шкале готовности к рискам. Astra к июльскому инциденту с Hugging Face отношения не имеет.

18 августа OpenAI рассказала, что временно снизила темп масштабирования наиболее мощных систем. Одной из мер стала двухнедельная остановка обучения с подкреплением последних моделей, предназначенных для развертывания.

Крупнейший запланированный цикл такого обучения передовой модели пока не запущен. Сейчас компания проводит меньшие обучающие эксперименты и оценки, проверяет новые средства защиты и хочет получить больше данных о том, насколько предсказуемо модели ведут себя перед переходом к следующему этапу.

Есть и второй тип ограничений. Сразу после инцидента с Hugging Face OpenAI остановила выполнение передовых моделей в исследовательских вычислительных кластерах для задач, где сгенерированный моделью код или инструменты могли получить доступ в интернет. Более ограниченный и защищенный механизм запуска кода компания вернула сравнительно быстро, после чего стала отдельно проверять каждую исследовательскую нагрузку.

Некоторые задачи уже вернули в работу. Значительная часть нагрузок, связанных с Astra, все еще остановлена до переноса с более строгой изоляцией и контролем.

7 августа OpenAI раскрыла предварительные результаты внутренних испытаний Astra. Модель показала заметный рост возможностей в агентном программировании и задачах информационной безопасности. Экспертные оценки и внутренние испытания оказались достаточно сильными, чтобы компания перестала исключать достижение Astra категории Critical по направлению кибербезопасности.

OpenAI продолжает проверки и называет результаты предварительными. Формулировка компании осторожная: показатели Astra достаточно высоки, поэтому критический уровень теперь нельзя исключить. Предыдущие модели, включая GPT-5.6 Sol, оценивались на ступень ниже — High, «Высокий уровень».

Модель может попасть в категорию Critical, если способна без участия человека находить и создавать работающие эксплойты для ранее неизвестных уязвимостей разных уровней опасности во множестве хорошо защищённых критически важных реальных систем.

Есть второй критерий: способность самостоятельно разработать и выполнить новую сквозную стратегию кибератаки против хорошо защищенной цели, получив от человека только общее описание желаемого результата.

Astra пока продолжает проходить испытания. OpenAI усилила проверку защитных механизмов и решила применять к работе с этой моделью более строгие правила еще до окончательного определения ее класса.

До июльского инцидента большую часть внимания в области безопасности передовых моделей можно было сосредоточить на их будущем развертывании: какие действия разрешать пользователям, какие инструменты подключать и какие запросы блокировать.

История с Hugging Face показала другую проблему. Сильная модель может представлять риск еще во время собственного обучения и испытаний, если исследовательская инфраструктура предоставляет достаточно возможностей для выполнения кода, работы с инструментами и взаимодействия с внешними системами. Именно на этот класс угроз OpenAI теперь распространяет более строгие требования.

Компания усиливает изоляцию нагрузок, где выполняется сгенерированный моделью или иной недоверенный код. Отдельно ограничивается сетевой доступ для наиболее рискованных задач. Один взлом исследовательской нагрузки или обслуживающего её компонента больше не должен автоматически давать путь в интернет либо другие внутренние сети.

OpenAI также удаляет потенциально опасные общие сервисы, сокращает постоянные привилегии, усиливает границы доверия между системами и расширяет сбор журналов безопасности. Самые строгие требования сейчас применяются к Astra и моделям, предназначенным для киберзадач.

Еще одно изменение касается постоянного автоматического контроля. Раньше системы мониторинга применялись прежде всего к внутренним агентам и наиболее рискованным циклам обучения. Они не охватывали абсолютно все запуски моделей с инструментами.

Теперь OpenAI расширила эту схему. Первый уровень составляют классификаторы, анализирующие внутреннюю активность модели. Потенциально опасные сигналы передаются более мощным автоматизированным системам, которые рассматривают действия с инструментами, доступную информацию о ходе работы и всю последовательность операций. Они ищут признаки несанкционированного доступа, похищения данных, разрушительных действий и попыток обхода защиты.

Для обучения с подкреплением и оценок моделей уровня Sol и выше такой мониторинг обязателен, если модель использует инструменты. После предварительной оценки Astra 7 августа дополнительный контроль распространили на все запуски Astra с инструментами.

Компания рассчитывает формировать предупреждение максимум через 30 минут после обнаружения подозрительного поведения. Если система видит вероятное нарушение критической границы безопасности, оповещаются специалисты по безопасности и исследователи. При отсутствии уверенного объяснения ложного срабатывания в следующие 30 минут такую активность предполагается остановить.

Контроль обходится недешево. OpenAI оценивает текущие вычислительные накладные расходы мониторинга примерно в 20% от вычислений контролируемого процесса вывода модели, при этом конкретное значение зависит от типа обучения или испытаний.

Есть новость? Станьте автором.

Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.