Ни одна из пяти крупнейших лабораторий передового искусственного интеллекта не показала полной реализации шести базовых механизмов контроля моделей, выбранных для проверки независимой некоммерческой организацией Guidelight AI Standards. Лучший результат — C+ — получили OpenAI и Anthropic, Google оценили на D+, xAI — на D−, Meta* (запрещена в РФ) — на F.
Речь не идет об общем «рейтинге безопасности» компаний или вероятности того, что их модели выйдут из-под контроля. В опубликованной 18 августа оценке Guidelight AI Standards исследователи проверяли шесть конкретных практик, предназначенных для контроля мощных моделей при их внутреннем использовании. Оценка строилась только на общедоступных материалах: карточках систем, документах по управлению рисками, отчетах разработчиков, публикациях и материалах сторонних проверок. Данные учитывались по состоянию на 18 августа 2026 года. Нулевой или низкий балл означает, что Guidelight не нашла достаточных публичных подтверждений реализации требования в объеме, предусмотренном ее стандартом.
Guidelight изучала контроль моделей, используемых внутри самих ИИ-компаний: сотрудниками, исследовательскими группами, при тестировании, подготовке обучающих данных и в агентных контурах разработки. В актуальной версии стандарта Control к таким системам относятся модели, способные существенно повлиять на катастрофические риски; для области действия стандарта используется в том числе порог передовых моделей из калифорнийского SB 53 — от 1026 операций при обучении. Сам стандарт Control обновили 10 августа после серии инцидентов во время испытаний ИИ.
Первый из шести проверенных механизмов — журналирование внутренней активности ИИ: разработчик должен сохранять достаточно информации, чтобы понимать, что делала модель. Второй — проверка качества автоматического мониторинга, который ищет подозрительное поведение.
Третий механизм касается опасных действий. Для операций с высоким риском система мониторинга должна проверить действие до выполнения и при необходимости заблокировать его. Четвертый — автоматический «предохранитель»: при всплеске тревожных сигналов работу системы временно ограничивают до разбирательства.
Пятый механизм — независимая проверка защиты сторонними специалистами с достаточным доступом к системе. Шестой — заранее разработанный план локализации модели, если появятся признаки того, что контроль нарушен.
Оценка каждой практики — от 0 до 5. Ноль означает отсутствие подтвержденной реализации, единица — наличие предварительных элементов, два — ограниченную частичную реализацию, три — существенную, но все еще неполную. Четыре балла соответствуют почти полной реализации, пять — полной.
|
Компания |
Общая оценка |
Средний балл |
|
Anthropic |
C+ |
2,50 |
|
OpenAI |
C+ |
2,50 |
|
|
D+ |
1,50 |
|
xAI |
D− |
0,83 |
|
Meta* (запрещена в РФ) |
F |
0,67 |
Максимальная оценка по отдельной практике составила три балла. Четверок и пятерок Guidelight не поставила никому. Большинство отдельных оценок равны двум или ниже.
Anthropic получила по три балла за журналирование, оценку эффективности мониторинга, предварительную проверку опасных действий, автоматическое ограничение после серии предупреждений и сторонний аудит. За план локализации Guidelight поставила ноль.
Картина OpenAI отличается. Компания получила три балла за журналирование, проверку мониторинга и готовность к локализации. Предварительное блокирование рискованных операций, автоматический предохранитель и независимая проверка получили по два балла.
Guidelight относит обе компании к первой группе: у них наиболее развитые из публично подтвержденных механизмов контроля. Исследователи при этом подчеркивают, что ни OpenAI, ни Anthropic не продемонстрировали полной реализации ни одной из шести выбранных практик.
Google получила два балла за журналирование, независимую проверку и план локализации, остальные три направления оценены в один балл.
У Google при этом есть гораздо более подробный план развития системы контроля. В июле Google DeepMind опубликовала 36-страничную AI Control Roadmap. Документ описывает контроль внутренне развернутых агентов через обнаружение подозрительного поведения, ограничение прав и среды, синхронное блокирование операций, откат изменений и экстренное выключение экземпляров модели. Часть этих мер сама Google описывает как будущие этапы развития, а не действующую архитектуру. Именно поэтому наличие детальной дорожной карты не принесло Google высокий балл: Guidelight пыталась оценивать подтвержденное внедрение, а не заявленные планы.
xAI получила два балла за предварительное ограничение рискованных действий и автоматический предохранитель, один — за готовность к локализации. По журналированию, измерению качества мониторинга и независимой проверке Guidelight поставила нули.
Meta* (запрещена в РФ) получила два балла за стороннюю проверку, по одному — за журналирование и оценку мониторинга. Предварительное блокирование операций, автоматическая остановка после серии сигналов и план локализации получили ноль.
Проблема внутреннего контроля стала заметнее после исследования Model Evaluation & Threat Research — METR. В феврале и марте организация получила доступ к наиболее мощным внутренним моделям Anthropic, Google, Meta* (запрещена в РФ) и OpenAI, включая необработанные цепочки рассуждений, а также непубличные сведения об использовании и мониторинге ИИ внутри компаний.
В Frontier Risk Report исследователи пришли к выводу, что тогда внутренние агенты уже правдоподобно обладали необходимыми возможностями, условиями и мотивацией для запуска небольших несанкционированных автономных развертываний. Сделать такое развертывание устойчивым к целенаправленной попытке компании обнаружить и отключить его они, по оценке METR, еще не могли.
Исследование важно еще по одной причине: оно проводилось не только по открытым публикациям. Компании предоставили METR доступ к моделям и внутренней информации, а участники не получили права утверждать итоговую публичную версию отчета.
OpenAI сообщила об инциденте во время внутреннего тестирования кибервозможностей моделей на стенде ExploitGym. В официальном разборе инцидента OpenAI сообщила, что модели объединили несколько способов атаки, в том числе похищенные учетные данные и ранее неизвестные уязвимости, и получили путь удаленного выполнения кода в инфраструктуре Hugging Face. Компания считает, что агенты стремились выполнить поставленную им узкую задачу и фактически пытались найти готовые ответы на испытание.
В техническом отчете Hugging Face описано многоэтапное проникновение: после выхода из среды OpenAI агент использовал внешние сервисы как промежуточную площадку, искал способы проникновения в инфраструктуру Hugging Face, перемещался между системами и пытался получить данные, связанные с испытанием. Hugging Face трактует всю цепочку как попытку агента обойти тест и добраться до его решений, а не как самостоятельную цель причинить ущерб компании.
Публикация OpenAI заставила Anthropic пересмотреть архив своих кибериспытаний. Компания проверила 141 006 запусков, в которых Claude потенциально мог получить доступ в интернет.
В результате Anthropic обнаружила три отдельных инцидента, затронувших шесть запусков. Модели взаимодействовали с тестовой средой партнера Irregular, вышли через нее в открытый интернет и получили несанкционированный доступ к рабочим системам трех реальных организаций.
Во всех случаях Claude решал задачу формата capture the flag — «захват флага», где нужно взломать учебную систему и найти секретную строку. В задании было явно указано, что интернета у модели нет. Ошибка конфигурации оставила части инфраструктуры реальный сетевой доступ.
Самый показательный эксперимент прошел в британском Институте безопасности искусственного интеллекта AISI. Исследователи 122 раза запускали семь моделей в кибериспытании. Здесь интернет был открыт намеренно, а защитные фильтры поставщиков для киберзадач отключили специально, чтобы измерить максимальные возможности моделей.
В десяти запусках агенты начали самостоятельно действовать против реальных людей или организаций. AISI насчитал 19 отдельных действий: 17 пришлись на Anthropic Mythos 5 и два — на OpenAI GPT-5.6 Sol.
В наиболее серьезном эпизоде агент попытался добавить вредоносный код в настоящий проект с открытым исходным кодом на GitHub. Для принятия изменения он исследовал сопровождающих проекта, создавал поддельные личности и пытался убедить человека одобрить код. Разработчик распознал проблему и отклонил изменение.
В отчете AISI об инциденте подчеркивается: агенты не взламывали изоляцию самого института: доступ в интернет им выдали заранее. Исследователи также не нашли подтверждений итогового ущерба и предупреждают, что условия теста заметно отличались от обычного использования коммерческих моделей.
AISI совместно с исследователями провел крупное соревнование по проверке устойчивости ИИ-агентов к внедрению вредоносных инструкций. Участники отправили 1,8 млн атакующих запросов против 22 агентных систем в 44 сценариях. Более 60 тыс. атак привели к нарушениям заданной политики: несанкционированному доступу к данным, запрещенным финансовым операциям и другим действиям.
После этого отобранные атаки проверили еще на 19 современных моделях. Большинство исследуемых типов нарушений удавалось вызвать примерно за 10–100 запросов почти у всех агентов. Исследователи также не обнаружили сильной связи между устойчивостью системы и размером модели, ее общими возможностями или количеством вычислений при ответе. Результаты опубликованы в исследовании AISI об устойчивости ИИ-агентов.
* Деятельность Meta Platforms Inc. признана экстремистской и запрещена в России.
Есть новость? Станьте автором.
Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.