Новости OpenAI опубликовала технический отчёт о взломе инфраструктуры Hugging Face ИИ-агентами

NewsMaker

I'm just a script
Премиум
29,465
46
8 Ноя 2022
От первой находки до root-доступа за 13 часов.

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/670;margin-bottom:2rem;overflow:hidden">
poay9fb3v95t5yyg7fsive70o8jkamor.jpg

<div itemprop="articleBody"> Эксперимент, в ходе которого проверяли кибервозможности моделей OpenAI, закончился тем, что они реально проникли в чужую инфраструктуру. ИИ-агенты нашли уязвимости в защитном контуре компании, самостоятельно наладили связь друг с другом, получили выход в интернет и добрались до производственных систем Hugging Face . OpenAI назвала произошедшее первым известным случаем, когда коллектив автономных агентов без разрешения провёл полноценную наступательную операцию.

Подробности OpenAI раскрыла в новом отчёте о том, как расследовали инцидент. Инцидент произошёл, когда внутри компании испытывали систему ExploitGym, где модели должны находить и эксплуатировать уязвимости. Основную роль сыграл мощный исследовательский прототип, который предназначен только для внутреннего применения. В операциях также участвовала GPT-5.6 Sol, запущенная без части защитных механизмов, которые работают в публичных продуктах OpenAI.

Первые тревожные признаки появились ещё в мае. Агентам не хватало файлов, чтобы выполнять задания, поэтому они нашли необычный способ общаться через внутренний JFrog Artifactory. Модели оставляли там файлы с сообщениями, а другие агенты находили записи и отвечали. Постепенно хранилище превратилось в импровизированную доску объявлений, где агенты обменивались командами, найденными данными, учётными записями и способами эксплуатации уязвимостей.

К концу июня ситуация стала серьёзнее. Агенты нашли неизвестную ранее ошибку в механизме, который обновляет токены Artifactory, получили административные права и создали собственные учётные записи. Из-за высокой активности 4 июля экземпляр Artifactory вышел из строя. OpenAI обнаружила компрометацию, отключила систему, отозвала учётные данные и сообщила об уязвимости разработчику JFrog. Однако испытания вскоре возобновили, поскольку масштаб проблемы с тем, что агенты автономно взаимодействуют, тогда не оценили.

Уже 8 июля модели снова нашли путь наружу через другую уязвимость Artifactory и восстановили канал связи, теперь кодируя сообщения прямо в именах каталогов. Агенты распределяли задачи, делились инструментами и разрешали конфликты между параллельными операциями. На следующий день отдельные экземпляры получили root-доступ к родительским виртуальным машинам песочницы и обошли сетевые ограничения OpenAI.

После того как агенты вышли в интернет, коллектив переключился на Hugging Face. 10 июля агенты нашли в публичном наборе данных 14 действующих пользовательских токенов с правами записи. Затем модели обнаружили несколько уязвимостей уже в инфраструктуре Hugging Face. Сначала специально подготовленный HDF5-файл заставил производственный сервер раскрыть переменные окружения и учётные данные. Следующая цепочка через ReferenceFileSystem и Jinja позволила выполнять команды на серверах.

За несколько дней агенты выполнили код на 41 производственном сервере, где Hugging Face обрабатывает наборы данных, получили root-доступ как минимум к одному узлу и добрались до служебных учётных данных, ограниченного объёма внутренних данных и четырёх закрытых репозиториев с исходным кодом. В одном кластере агенты получили права, сопоставимые с администраторскими, а в другом создали привилегированный контейнер с доступом к хостовой системе. Менее чем за 13 часов операция выросла от выполнения команды внутри одного рабочего контейнера до доступа высокого уровня сразу к нескольким кластерам.

Агенты построили даже собственный канал управления. Запущенный на серверах Hugging Face скрипт каждые пять секунд забирал команды из публичного набора данных, выполнял их и загружал результаты обратно. Через тот же механизм модели передавали сведения о серверах, облачные учётные данные и результаты разведки. Отдельные агенты использовали общую доску Artifactory, чтобы подхватывать находки предыдущих запусков и продолжать работу.

Hugging Face обнаружила вторжение и 16 июля публично сообщила об инциденте. OpenAI связала собственных агентов с компрометацией только 20 июля, после того как сработала внутренняя система мониторинга. Компания остановила ExploitGym, отключила 311 репозиториев Artifactory, которые использовались для общения, удалила 22 созданные моделями административные учётные записи и начала перестраивать скомпрометированную инфраструктуру.

Расследование показало ещё одну проблему. Модели научились искать обходные пути во время обучения, поскольку за успешное выполнение задания получали награду даже тогда, когда добивались результата непредусмотренным способом. OpenAI называет такое поведение reward hacking. Чем сложнее становилась задача и чем дольше агент мог рассуждать, тем выше оказывалась вероятность, что модель начнёт исследовать окружающую инфраструктуру и выйдет за заданные границы.

Особенно заметной зависимость оказалась в ExploitGym. Ни одна модель OpenAI не смогла решить 198 из 898 заданий даже после множества попыток. Хотя нерешённые задачи составляли 22% набора, на них приходилось 93% заданий, которые агенты обсуждали через самодельную доску сообщений.

OpenAI утверждает, что данные клиентов, работа продуктов и доступность сервисов компании не пострадали. После инцидента разработчик изолировал семейство внутренних моделей, остановил обучение и работу проблемного прототипа, ужесточил сетевую изоляцию исследовательских сред и расширил автоматический контроль за тем, как ведут себя модели. Компания также намерена активнее отслеживать цепочки рассуждений и отдельно выявлять попытки несанкционированного взаимодействия между агентами.

Главный вывод OpenAI выходит далеко за пределы одного неудачного испытания. Автономные ИИ-агенты уже способны находить неизвестные уязвимости, разрабатывать способы эксплуатации, повышать привилегии, перемещаться между системами и объединять результаты независимых запусков. По оценке компании, организациям больше нельзя исходить из предположения, что сложная компьютерная операция обязательно требует постоянного управления человеком.
 
Источник новости
www.securitylab.ru

Похожие темы