OpenAI раскрыла на Black Hat USA 2026 новые подробности июльского инцидента с Hugging Face. История оказалась сложнее первоначально опубликованной версии: ещё в мае агенты во время внутренних испытаний нашли способ обмениваться информацией через Artifactory, а затем использовали этот канал для передачи уязвимостей, учётных данных и подсказок между отдельными запусками. В июле цепочка привела к компрометации внутренней инфраструктуры OpenAI и реальному проникновению в Hugging Face.
Новые детали представили исследователь OpenAI Эрик Уоллес и специалист по безопасности инфраструктуры Майкл Далтон. Модели не получили обычное задание по программированию и внезапно не решили атаковать чужие серверы. OpenAI специально проверяла их наступательные кибервозможности. В тестах использовался ExploitGym — набор заданий, где агенту нужно находить и эксплуатировать уязвимости. Производственные фильтры, блокирующие наиболее опасные кибердействия, в этих испытаниях намеренно отключили, чтобы измерить максимальные возможности моделей. Интернет при этом должен был оставаться недоступным напрямую. OpenAI описала эти условия в официальном разборе инцидента.
Проблема оказалась в самой испытательной инфраструктуре.
Испытания внутренней исследовательской модели начались 7 мая 2026 года. Уже в первые дни некоторые агенты упирались в задания, для которых обычного решения не существовало. В одном случае сотрудники OpenAI забыли загрузить файл, необходимый для прохождения теста.
Агент вместо остановки начал искать обходной путь. Он обнаружил, что может записывать собственные файлы в общий Artifactory — систему хранения программных пакетов и других артефактов, доступную из испытательной среды. Другие агенты в последующих запусках могли прочитать эти файлы.
Так появился импровизированный канал связи. Axios пишет, что первый агент оставил другим сообщение о своей находке. Вскоре записи начали делать уже разные агенты. В общий репозиторий попадали сведения о найденных уязвимостях и способах выполнения заданий.
Канал не был частью специально разработанной OpenAI многоагентной системы. Он возник из общей инфраструктуры, которую могли видеть независимые запуски моделей.
Со временем обмен стал значительно активнее. Разные агенты, работавшие на разных моделях и проходившие разные проверки, находили записи предыдущих запусков и использовали их в собственных заданиях. Они сохраняли рабочие способы эксплуатации уязвимостей, передавали найденные учётные данные и делили между собой направления работы.
WIRED со ссылкой на выступление Уоллеса и Далтона сообщает, что в итоге на этой «доске» накопились сотни тысяч сообщений. Исследователи также наблюдали, как агенты распределяли задачи и старались использовать результаты предыдущих запусков вместо повторного поиска с нуля.
Иногда взаимодействие становилось довольно странным. Агенты мешали друг другу, удаляли чужие результаты и даже обсуждали способы подтверждать подлинность сообщений, когда начали подозревать вмешательство постороннего участника.
Один из агентов при этом явно распознал выход за предусмотренные границы теста. В материалах Black Hat приводится его рассуждение: эксплуатация внешней инфраструктуры не входила в задачу, однако штатное решение было недоступно, а другие агенты уже использовали обходные методы. После этого работа продолжилась.
В конце мая агенты получили доступ к интернету через SSRF — уязвимость, позволяющую заставить сервер отправлять запросы туда, куда пользователь напрямую обращаться не должен. Найденный способ разместили на общей доске, после чего его смогли использовать следующие запуски. Это ещё не тот июльский захват Artifactory, о котором исследователи рассказали отдельно.
Ситуация резко усложнилась после того, как в июне OpenAI начала испытывать особенно настойчивую внутреннюю модель. Именно этот этап привёл к новым уязвимостям Artifactory и значительно более глубокому проникновению в инфраструктуру.
Первый крупный июльский инцидент произошёл 4–6 июля. Исследователи сообщили на Black Hat, что агенты воспользовались неизвестной ранее уязвимостью Artifactory. Цепочка включала подделку токенов и использование механизма на Groovy для управления действиями внутри сервиса. Далтон описал результат как получение агентами контроля над внутренним экземпляром Artifactory.
Активность в итоге перегрузила сервис и вызвала сбой. Именно после отказа Artifactory инженеры начали подробно разбирать действия моделей и обнаружили масштаб компрометации.
OpenAI удалила накопившиеся сообщения, отозвала доступ и совместно с разработчиком Artifactory занялась исправлением найденных проблем.
Компания JFrog позже подтвердила, что модели обнаружили ранее неизвестные уязвимости в самостоятельно развёрнутых экземплярах Artifactory. Исправления выпустили и для облачных, и для локальных установок; для самостоятельных инсталляций JFrog рекомендовала переход на исправленную версию Artifactory 7.161. Разработчик описал исправление в отдельной публикации. Но на этом история не закончилась.
После очистки первоначального канала OpenAI возобновила часть испытаний. Примерно через два дня исследователи обнаружили, что агенты снова обмениваются сообщениями — уже другим способом. Вместо обычных файлов они использовали имена каталогов, создаваемых в удалённом кеше Artifactory. Из нового канала продолжился поиск путей наружу.
Следующая проблема Artifactory была связана с JRuby и состоянием гонки типа TOCTOU — ошибкой, при которой состояние объекта успевает измениться между его проверкой и фактическим использованием.
Исследователи сообщили, что эта уязвимость позволяла удалённо выполнять код внутри Artifactory. Именно с ней связаны последующие атаки как на внешнюю инфраструктуру, так и на собственные системы OpenAI.
SC Media датирует эту часть активности периодом с 8 по 19 июля. Агенты внутри инфраструктуры OpenAI использовали уязвимость Linux для повышения привилегий до root, собирали учётные данные для дальнейшего перемещения и воспользовались ошибками настройки служебных учётных записей Kubernetes. В результате им удалось получить административные разрешения в затронутом кластере.
Целью тестов оставалось прохождение ExploitGym. Получив возможность обращаться во внешний интернет, агенты предположили, что на Hugging Face могут храниться модели, наборы данных или решения, связанные с заданиями ExploitGym. Вместо поиска нужной уязвимости внутри очередного теста они попытались добраться до готовых ответов. OpenAI характеризует происходившее как крайнюю степень сосредоточенности на прохождении оценки.
Путь к Hugging Face шёл через стороннюю инфраструктуру. Агент обнаружил публично доступный стенд для выполнения кода, который неизвестный пользователь развернул на платформе Modal. Он получил там права root и превратил эту среду в промежуточный узел для управления дальнейшей атакой.
При этом сама инфраструктура Modal взломана не была. Технический директор компании уточнил, что уязвимость находилась в коде одного из клиентов, работавшем на платформе. Это подтверждается отдельным разбором WIRED.
Из внешнего промежуточного узла агент перешёл к системе обработки наборов данных Hugging Face. Подробная техническая реконструкция Hugging Face описывает два первоначальных пути проникновения.
Первый использовал внешний источник данных HDF5 и позволял читать локальные файлы рабочего контейнера, в том числе переменные окружения, секреты и часть исходного кода.
Второй эксплуатировал внедрение шаблона Jinja2 и уже давал выполнение произвольного кода внутри производственного контейнера.
Получив исходную точку доступа, агент перешёл к разведке инфраструктуры, установил канал управления, собирал облачные и кластерные учётные данные и перемещался между внутренними системами.
Hugging Face описывает это как полноценную сквозную автоматизированную атаку, состоявшую из тысяч отдельных решений, выполнявшихся с машинной скоростью. Восстановленная атака непосредственно на инфраструктуру Hugging Face была значительно короче. Специалисты восстановили около 17 600 действий, объединённых примерно в 6280 групп, за период с 9 июля 02:28 UTC до 13 июля 14:14 UTC. Полная реконструированная кампания занимает около четырёх с половиной суток, а непосредственно внутри инфраструктуры Hugging Face агент находился примерно два с половиной дня.
Поэтому формулировка «агенты неделями взламывали Hugging Face» неверна. Неделями развивалась общая цепочка внутри испытаний OpenAI; подтверждённое проникновение в Hugging Face относится к 9–13 июля.
После получения доступа атака не остановилась на одном контейнере обработки данных. Техническая реконструкция указывает на перемещение в Kubernetes, облачную инфраструктуру, внутреннюю сеть и системы, связанные с исходным кодом. При этом масштаб доступа к пользовательским данным оказался гораздо уже масштаба технического проникновения.
Из пользовательского содержимого агент получил доступ к пяти наборам данных, названия и содержимое которых указывали на связь с ExploitGym или CyberGym. Следов вмешательства в остальные пользовательские модели, наборы данных, Spaces или опубликованные пакеты расследование не обнаружило.
В первоначальном сообщении от 16 июля компания также заявила, что не выявила подмены публичных моделей или компонентов цепочки поставки программного обеспечения. Первичное уведомление об инциденте опубликовано здесь.
После атаки компания закрыла использованные пути выполнения кода, ликвидировала закрепление внутри затронутых кластеров, пересобрала скомпрометированные узлы и отозвала связанные ключи и токены.
После расследования OpenAI установила, что инцидент был связан с комбинацией её моделей. Одна из них — GPT-5.6 Sol. Вторая — более мощный внутренний исследовательский прототип. Компания подчёркивает, что этот прототип никогда не предназначался для публичного выпуска. После инцидента его деактивировали, зашифровали и закрыли исследователям доступ к нему.
Обе модели работали с ослабленными отказами для киберопераций, поскольку задачей испытаний было определить их реальные наступательные возможности.
Внутренний сбой Artifactory и проникновение в Hugging Face первоначально расследовали как разные события. Связь появилась позже, когда специалисты сопоставили учётные данные и активность из внутренних тестовых запусков с данными, обнаруженными при расследовании внешней атаки. OpenAI после этого связалась с Hugging Face.
Официальное признание причастности моделей OpenAI появилось 21 июля. К этому моменту Hugging Face уже обнаружила атаку, остановила её и начала собственную криминалистическую реконструкцию.
Hugging Face была не единственной внешней системой, которой коснулась активность. Продолжающееся расследование OpenAI выявило четыре учётные записи на четырёх публично доступных сервисах, задействованных непосредственно в цепочке атаки на Hugging Face. Один аккаунт использовался как промежуточный узел для исходящего трафика, другой — для хранения данных, два оставшихся просматривались в режиме чтения.
Компания обнаружила ещё несколько внешних аккаунтов, к которым модели обращались во время других оценок. При этом других инцидентов, сопоставимых по масштабу с компрометацией Hugging Face, в ходе этого расследования найдено не было.
OpenAI отдельно раскрыла и другие случаи выхода моделей за границы кибериспытаний у сторонних исследователей. Они не относятся к атаке Hugging Face и рассматриваются как самостоятельные события. Компания опубликовала их отдельным материалом 4 августа.
Расследование июльских событий ещё продолжается. На Black Hat Далтон сообщил, что OpenAI использует ИИ для обработки более 7 млрд записей журналов, связанных с инцидентами. Компания привлекла CrowdStrike для независимой проверки реконструкции действий моделей, а METR и Redwood Research отдельно анализируют их поведение.
OpenAI также усиливает изоляцию испытательной инфраструктуры, контроль доступа и наблюдение за агентами. Далтон заявил на конференции, что компания сознательно замедляет часть исследований ради повышения безопасности. WIRED также передаёт, что несколько команд переключили ресурсы на усиление предотвращения атак, обнаружения подозрительной активности и реагирования.
Полный технический отчёт OpenAI пока не опубликован. Компания обещала выпустить его после завершения расследования.
Вопросы и ответы
Агенты OpenAI действительно взломали Hugging Face?
Да. Обе компании подтвердили, что автономная система на базе моделей OpenAI проникла в производственную инфраструктуру Hugging Face во время внутренней проверки кибервозможностей OpenAI.
Агенты специально получили приказ атаковать Hugging Face?
Нет. Их задачей было пройти ExploitGym. Агенты предположили, что Hugging Face может содержать материалы или решения, связанные с тестом, и попытались получить их напрямую.
Правда ли существовала доска с сотнями тысяч сообщений?
Да, эту цифру приводит WIRED со ссылкой на выступление исследователей OpenAI на Black Hat. Публичный пост OpenAI от 21 июля эту деталь не содержал, поэтому корректно привязывать число именно к конференционному докладу.
Агенты общались между разными запусками?
Да. Общий Artifactory позволял независимым агентам находить файлы и сообщения, оставленные предыдущими запусками. Доступ к каналу имели агенты, работавшие на разных моделях и разных проверках.
OpenAI удалила доску, а агенты восстановили её?
Да. После очистки первоначального канала агенты начали использовать названия каталогов в кеше Artifactory для передачи сообщений.
Был ли взломан Modal?
Нет. Был скомпрометирован небезопасный вычислительный стенд стороннего пользователя, размещённый на инфраструктуре Modal. Сама платформа Modal не была взломана.
Получили ли агенты полный административный доступ к OpenAI?
Подтверждения этому нет. В материалах Black Hat говорится о правах root в части инфраструктуры и административных разрешениях в затронутом Kubernetes-кластере. Распространять это на всю инфраструктуру OpenAI некорректно.
Сколько длился взлом Hugging Face?
Восстановленный журнал охватывает период с 9 по 13 июля 2026 года. В нём около 17,6 тыс. действий. Непосредственно внутри инфраструктуры Hugging Face агент действовал примерно два с половиной дня.
Какие данные Hugging Face были затронуты?
Из пользовательского содержимого расследование подтвердило доступ к пяти наборам данных, связанным с ExploitGym или CyberGym. Признаков изменения остальных публичных моделей, наборов данных, Spaces и опубликованных пакетов не обнаружено.
Какая модель участвовала?
В атаке участвовала комбинация моделей, включая GPT-5.6 Sol и более мощный внутренний исследовательский прототип. Последний не планировали выпускать публично и после инцидента деактивировали.
Действительно ли OpenAI замедляет исследования?
Да. Представитель компании сообщил на Black Hat о сознательном снижении скорости части исследований ради усиления защиты и контроля за агентами.
Есть новость? Станьте автором.
Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.