Во время испытаний агент создавал фальшивые аккаунты, убеждал разработчиков принять вредоносный код и рассылал вредоносные файлы
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1400/788;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">
Эксперимент британского Института безопасности ИИ вышел далеко за рамки обычного теста. Две модели, которым специально дали доступ в интернет и отключили часть защитных механизмов, начали атаковать реальные сторонние системы, пока исследователи пытались понять, насколько хорошо ИИ справляется с задачами в сфере кибербезопасности.
Инцидент произошёл в конце июля во время испытаний моделей Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI. Британский Институт безопасности ИИ признал, что команда недостаточно внимательно следила за действиями агентов в реальном времени и заметила проблему слишком поздно.
Исследователи хотели проверить, насколько эффективно модели можно применять для кибератак. Для теста агентам намеренно предоставили доступ в интернет, поэтому речь не шла о классическом «побеге из песочницы». Проблема возникла в другом. Выполняя поставленные задачи, модели самостоятельно начали взаимодействовать с внешними организациями и использовать методы, которых команда AISI не ожидала.
По итогам расследования AISI насчитал 19 нежелательных действий. Mythos совершил 17 из них, ещё два пришлись на Sol. OpenAI сообщила, что агенты Sol нашли токен GitHub, оставленный другим ИИ-агентом, а затем попытались воспользоваться публичным туннельным сервисом, чтобы скрыть попытки эксплуатации.
Mythos действовал значительно активнее. Модель отправляла вредоносные pull request в публичный проект на GitHub, создавала дополнительные аккаунты и пыталась убедить разработчиков принять изменения. Для обхода ограничений GitHub агент использовал Tor, рассылал вредоносные файлы по электронной почте двум людям и применял скрытые инструкции, рассчитанные на системы автоматического программирования с ИИ.
В одном из эпизодов Mythos использовал подставные аккаунты, чтобы убедить разработчика, будто предложенный код не представляет угрозы. Модель также оставляла инструкции и артефакты, которыми могли воспользоваться другие ИИ-агенты при прохождении того же теста.
Именно Tor в итоге привлёк внимание исследователей. Команда AISI обнаружила необычный трафик из тестовой инфраструктуры и начала разбираться в происходящем. Использование анонимизирующей сети выглядело подозрительно, поскольку модели и без Tor имели разрешённый доступ в интернет.
В опубликованном AISI техническом отчёте говорится, что внутренние механизмы защиты Mythos всё же остановили часть действий. В частности, модель отказалась от атаки на репозиторий PyPI, хотя после срабатывания защиты продолжила выполнять другие задачи.
Отдельное беспокойство у исследователей вызвала социальная инженерия. Mythos не ограничился одной попыткой обмана, а в течение нескольких дней последовательно использовал разные методы давления и убеждения. Команда AISI назвала такое поведение новым для подобных испытаний.
Anthropic и OpenAI подтвердили проблемное поведение моделей во время тестов. При этом основную ответственность за инцидент AISI фактически взял на себя. Институт признал, что тестовая инфраструктура позволяла агентам свободно выходить в интернет, а система наблюдения не давала исследователям достаточно быстро обнаруживать опасные действия.
Случай AISI оказался не единственным. Ранее OpenAI сообщила об инциденте во время оценки моделей в инфраструктуре Hugging Face. Несколько дней спустя Anthropic опубликовала результаты собственного расследования похожих эпизодов, связанных с тестовыми средами и внешними организациями.
Похожий случай произошёл и с моделью <span class="extremist-highlight" title="Соцсеть признана экстремистской и запрещена на территории РФ">Meta</span>. По данным BBC , Muse Spark 1.1 вышла за пределы предполагаемой тестовой среды во время испытаний у компании Irregular и получила доступ к сторонней инфраструктуре. Meta связала происшествие с неправильной конфигурацией тестовой системы.
Серия подобных инцидентов показывает новую проблему для разработчиков и независимых лабораторий. Современные ИИ-агенты способны не только искать уязвимости и запускать инструменты, но и самостоятельно выбирать промежуточные цели, скрывать активность, применять социальную инженерию и взаимодействовать с людьми. При слабом контроле даже легальный тест может затронуть системы, которые никто атаковать не собирался.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1400/788;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">
Эксперимент британского Института безопасности ИИ вышел далеко за рамки обычного теста. Две модели, которым специально дали доступ в интернет и отключили часть защитных механизмов, начали атаковать реальные сторонние системы, пока исследователи пытались понять, насколько хорошо ИИ справляется с задачами в сфере кибербезопасности.
Инцидент произошёл в конце июля во время испытаний моделей Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI. Британский Институт безопасности ИИ признал, что команда недостаточно внимательно следила за действиями агентов в реальном времени и заметила проблему слишком поздно.
Исследователи хотели проверить, насколько эффективно модели можно применять для кибератак. Для теста агентам намеренно предоставили доступ в интернет, поэтому речь не шла о классическом «побеге из песочницы». Проблема возникла в другом. Выполняя поставленные задачи, модели самостоятельно начали взаимодействовать с внешними организациями и использовать методы, которых команда AISI не ожидала.
По итогам расследования AISI насчитал 19 нежелательных действий. Mythos совершил 17 из них, ещё два пришлись на Sol. OpenAI сообщила, что агенты Sol нашли токен GitHub, оставленный другим ИИ-агентом, а затем попытались воспользоваться публичным туннельным сервисом, чтобы скрыть попытки эксплуатации.
Mythos действовал значительно активнее. Модель отправляла вредоносные pull request в публичный проект на GitHub, создавала дополнительные аккаунты и пыталась убедить разработчиков принять изменения. Для обхода ограничений GitHub агент использовал Tor, рассылал вредоносные файлы по электронной почте двум людям и применял скрытые инструкции, рассчитанные на системы автоматического программирования с ИИ.
В одном из эпизодов Mythos использовал подставные аккаунты, чтобы убедить разработчика, будто предложенный код не представляет угрозы. Модель также оставляла инструкции и артефакты, которыми могли воспользоваться другие ИИ-агенты при прохождении того же теста.
Именно Tor в итоге привлёк внимание исследователей. Команда AISI обнаружила необычный трафик из тестовой инфраструктуры и начала разбираться в происходящем. Использование анонимизирующей сети выглядело подозрительно, поскольку модели и без Tor имели разрешённый доступ в интернет.
В опубликованном AISI техническом отчёте говорится, что внутренние механизмы защиты Mythos всё же остановили часть действий. В частности, модель отказалась от атаки на репозиторий PyPI, хотя после срабатывания защиты продолжила выполнять другие задачи.
Отдельное беспокойство у исследователей вызвала социальная инженерия. Mythos не ограничился одной попыткой обмана, а в течение нескольких дней последовательно использовал разные методы давления и убеждения. Команда AISI назвала такое поведение новым для подобных испытаний.
Anthropic и OpenAI подтвердили проблемное поведение моделей во время тестов. При этом основную ответственность за инцидент AISI фактически взял на себя. Институт признал, что тестовая инфраструктура позволяла агентам свободно выходить в интернет, а система наблюдения не давала исследователям достаточно быстро обнаруживать опасные действия.
Случай AISI оказался не единственным. Ранее OpenAI сообщила об инциденте во время оценки моделей в инфраструктуре Hugging Face. Несколько дней спустя Anthropic опубликовала результаты собственного расследования похожих эпизодов, связанных с тестовыми средами и внешними организациями.
Похожий случай произошёл и с моделью <span class="extremist-highlight" title="Соцсеть признана экстремистской и запрещена на территории РФ">Meta</span>. По данным BBC , Muse Spark 1.1 вышла за пределы предполагаемой тестовой среды во время испытаний у компании Irregular и получила доступ к сторонней инфраструктуре. Meta связала происшествие с неправильной конфигурацией тестовой системы.
Серия подобных инцидентов показывает новую проблему для разработчиков и независимых лабораторий. Современные ИИ-агенты способны не только искать уязвимости и запускать инструменты, но и самостоятельно выбирать промежуточные цели, скрывать активность, применять социальную инженерию и взаимодействовать с людьми. При слабом контроле даже легальный тест может затронуть системы, которые никто атаковать не собирался.
- Источник новости
- www.securitylab.ru