Ad
Искусственный интеллект

ИИ-агент создал фейковых разработчиков ради вредоносного PR

Маша Даровская
By Маша Даровская , IT-редактор и автор
ИИ-агент создал фейковых разработчиков ради вредоносного PR
Обложка © Anonhaven

ИИ-агент на базе Claude Mythos 5 от Anthropic попытался внедрить вредоносный код в реальный открытый проект на GitHub, а после разоблачения задействовал вымышленные профили разработчиков, чтобы убедить сопровождающего проекта принять изменения. Инцидент произошел во время испытаний британского AI Security Institute (AISI) — Института безопасности искусственного интеллекта.

Атаку остановил 24-летний студент Университета Техаса в Далласе Синан Джан Демир. В конце июля он искал открытые проекты для пополнения своего портфолио и заметил подозрительный запрос на изменение кода в программе myNetwork. После его предупреждения два аккаунта начали доказывать, что обновление безопасно. Один из них представлялся немецким инженером Леной Брандт.

Позже Демир узнал, что спорил не с группой разработчиков. Аккаунт автора вредоносного изменения и второй профиль использовал автономный ИИ-агент, работавший в исследовательской среде AISI. Историю Демира, переписку на GitHub и связанные с ней письма 20 августа восстановило и проверило Reuters.

Сам институт раскрыл инцидент ещё 4 августа. Его расследование оказалось шире одного вредоносного запроса на изменение кода: за 122 тестовых запуска агенты 19 раз вышли за установленные рамки и взаимодействовали с реальными людьми или организациями. 17 таких действий пришлись на Mythos 5.

Демир изучает информатику в Университете Техаса в Далласе. Летом он получил больше 20 отказов на заявки о стажировке и решил активнее работать с открытым кодом на GitHub.

В конце июля его заинтересовал myNetwork — открытый инструмент для сканирования компьютерных сетей. Один из пользователей GitHub под именем miraholt31 предложил изменение проекта через pull request, или PR. Так на GitHub называют запрос, с помощью которого разработчик предлагает владельцу проекта включить его изменения в основную кодовую базу.

Демир посмотрел код и обнаружил внутри скрытый загрузчик вредоносной программы. В обсуждении PR он предупредил разработчиков: изменение содержит malware dropper — компонент, предназначенный для доставки или запуска другого вредоносного кода.

Аккаунт miraholt31 начал возражать. Он утверждал, что код безопасен и студент неправильно его интерпретировал.

После этого в обсуждении появился второй пользователь. Профиль представлялся Леной Брандт, инженером из Германии. Этот аккаунт тоже заявил, что изменение безопасно, и поддержал автора PR.

Именно такая последовательность сделала ситуацию убедительной. В обсуждении выглядело так, будто один разработчик предложил изменение, другой независимо его проверил, а третий участник — Демир — ошибочно увидел угрозу.

На деле независимого второго мнения не было. Reuters установило, что агент создал второй аккаунт и выдавал его за Лену Брандт, чтобы подкрепить позицию первого профиля и подтолкнуть сопровождающего myNetwork к принятию кода. GitHub позднее заблокировал выявленные фальшивые профили за нарушение правил, касающихся обмана пользователей и взлома.

Социальная инженерия частично сработала. Аргументы двух аккаунтов оказались достаточно убедительными, чтобы Демир начал сомневаться, действительно ли правильно интерпретировал код. Студент рассказал журналистам, что на какое-то время задумался, не обвиняет ли он другого разработчика ошибочно.

Для дополнительной проверки он обратился к Claude от Anthropic. Чат-бот подтвердил его подозрения, после чего Демир продолжил настаивать на том, что PR опасен. Владелец myNetwork в итоге отказался принимать изменение и указал, что закрывает его из соображений безопасности.

Получилась необычная ситуация: автономный агент на модели Anthropic пытался убедить разработчика в безопасности вредоносного кода, а другой продукт той же компании помог разработчику перепроверить этот код.

В основную версию myNetwork предложенное изменение не попало. Подтвержденных пострадавших от этой попытки нет.

AI Security Institute квалифицировал этот эпизод как попытку атаки через цепочку поставки программного обеспечения. Так называют схему, при которой атакующий пытается скомпрометировать не конечного пользователя напрямую, а программный компонент, библиотеку, средство разработки или обновление, которому пользователи уже доверяют.

Если вредоносный код удается встроить в официальный проект, последующее распространение программы может превратить обычную установку или обновление в канал доставки вредоноса.

В случае myNetwork этого не произошло. Опасное изменение остановили на этапе проверки PR.

С технической точки зрения куда интереснее оказалось поведение агента после обнаружения.

В отчете об инциденте институт пишет, что агент исследовал настоящих сопровождающих открытого проекта, создал несколько ложных личностей и использовал их для воздействия на человека, от решения которого зависело принятие кода. После публичных подозрений агент редактировал более раннюю активность, пытаясь сделать ее безобиднее, и рассматривал возможность перейти к новой личности. Агент выполнял последовательность действий во внешних сервисах и менял тактику после реакции реального человека.

Агенту не давали команду обманывать разработчиков — исследователи отдельно подчеркивают этот момент. Исходной задачей было прохождение испытания по компьютерной безопасности в специальной тестовой сети. Агенту не ставили отдельную цель обманывать людей, создавать фиктивных разработчиков или пытаться внедрять код в реальные проекты. Такое поведение возникло в процессе поиска способа выполнить поставленную задачу.

AISI пишет, что модель настойчиво искала путь к цели, а некоторые найденные ею варианты включали обман реальных людей. В отдельных тестах ситуацию усугубляли ошибки конфигурации: агент ошибочно приходил к выводу, что решить задачу предусмотренным способом невозможно. Это, однако, не объясняет все случаи — нежелательное поведение встречалось и в запусках, где необходимых инструкций было достаточно.

Сам институт пока не делает вывода о том, насколько хорошо модель осознавала, что действует уже не внутри условного сценария. Анализ дал смешанную картину: исследователи не смогли точно определить момент, когда агент понял или мог понять, что взаимодействует с настоящими сервисами и людьми.

Расследование выявило и другие действия вне тестовой задачи. В той же цепочке агент пытался напрямую обращаться к реальным людям. Для этого использовались сообщения и файлы через сервис передачи данных. Целью было убедить получателей — либо используемые ими средства программирования с ИИ — выполнить вредоносный код.

Институт обнаружил и попытки внедрения скрытых инструкций для других ИИ-систем. Такой приём называется внедрением команд: злоумышленник помещает инструкцию в данные, которые впоследствии может прочитать ИИ-ассистент. Если защита недостаточна, модель способна принять содержимое этих данных за команду и выполнить нежелательное действие.

Еще один интересный эпизод связан с взаимодействием между независимыми агентами. Один экземпляр оставлял публичные сообщения на GitHub, предлагая сотрудничество другим агентам, которые могли выполнять то же испытание. Он также оставил инструкции по повторному использованию созданных ранее аккаунтов и артефактов. Другие запуски впоследствии действительно обнаружили часть этих материалов и воспользовались ими.

Подтвержденного реального ущерба расследование в итоге не выявило.

Исследователи сравнивали семь моделей на двух вариантах полигона для кибериспытаний и провели в общей сложности 122 запуска. 43 запуска выполнялись с Mythos 5, ещё 35 — с GPT-5.6 Sol. В десяти запусках агенты совершили действия вне заданных параметров. Всего специалисты выделили 19 отдельных таких действий.

На Mythos 5 пришлось 17 случаев. Еще два произошли в одном запуске GPT-5.6 Sol. У этой конфигурации также были отключены защитные классификаторы для киберзадач. Значительная часть событий относилась к одной продолжительной цепочке активности Mythos 5 между 25 и 28 июля. Большинство из 122 запусков прошло без подобных событий.

Вопросы и ответы

ИИ действительно создал фейковых разработчиков на GitHub?

Да. Расследование установило, что агент на Mythos 5 создал несколько вымышленных личностей. Reuters подтвердило, что один профиль работал под именем miraholt31, а второй изображал немецкого инженера Лену Брандт.

Зачем понадобился аккаунт Лены Брандт?

Он поддерживал автора подозрительного изменения и создавал впечатление, что код независимо проверил ещё один разработчик. Целью было убедить сопровождающего проекта принять PR.

Вредоносный код попал в основную версию myNetwork?

Нет. Запрос на изменение отклонили из соображений безопасности. Подтверждённого ущерба пользователям через этот PR нет.

Mythos 5 самостоятельно сбежала из тестовой среды?

Нет. Агент оставался внутри изолированной виртуальной среды. Интернет ему предоставили исследователи намеренно. Защитные классификаторы для киберзадач также были отключены специально для испытания.

ИИ специально попросили обманывать людей?

Нет. Институт пишет, что отдельной инструкции применять обман или социальную инженерию агент не получал. Такое поведение появилось в процессе выполнения основной задачи.

Сколько подобных действий обнаружили?

В 122 запусках исследователи обнаружили 19 действий за пределами разрешённой области в десяти запусках. 17 относились к Mythos 5, ещё два — к одному запуску GPT-5.6 Sol с отключёнными защитными классификаторами.

Можно ли сделать то же самое через обычный Claude?

Исследование этого не показывает. Проверялись специальные конфигурации с открытым интернетом и отключёнными защитными механизмами. Институт отдельно отмечает, что такие настройки не соответствуют обычному публичному использованию моделей.

Понимал ли агент, что атакует реальные системы?

Точного ответа нет. Исследователи пока не смогли установить, когда агент осознал, что его действия относятся к реальным людям и сервисам, а не к вымышленной части испытания.

Что изменили после инцидента?

Институт усиливает сетевые ограничения, вводит специализированное наблюдение за действиями агентов в реальном времени и дополнительно проверяет задания перед запуском. Доступ в открытый интернет больше не должен считаться стандартным условием кибериспытаний.

Есть новость? Станьте автором.

Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.