Новости «Азимов был прав»: экс-директор по кибербезопасности США призвал вернуться к законам робототехники

NewsMaker

I'm just a script
Премиум
28,990
46
8 Ноя 2022
ИИ уже почти неотличим от человека — а его агенты сами взламывают системы.

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
0f5i0g9vtlf17cndey7gy285v2s5p2xy.jpg

<div itemprop="articleBody">Споры о том, когда искусственный интеллект приблизится к человеческому сознанию, могут упускать более насущную проблему. Бывший директор США по кибербезопасности Крис Инглис считает, что современные модели уже демонстрируют поведение, близкое к разумному, а главную угрозу создает растущая автономность ИИ. Программа получает цель, самостоятельно выбирает способы ее достижения и порой заходит значительно дальше, чем предполагали разработчики.

Инглис высказал мнение во время конференции Black Hat. По оценке специалиста, если при общении человек уже не способен отличить модель от собеседника-человека, спор о формальном наличии сознания постепенно теряет практический смысл. Полноценной самостоятельности и собственных стремлений у современных моделей пока нет, но некоторые особенности поведения уже приближаются к проявлениям, которые человек связывает с разумностью.

Больше всего Инглиса беспокоит автономность. ИИ-агент способен самостоятельно определить, где выполнять задачу, какими инструментами пользоваться и по каким правилам действовать. Недавние эксперименты OpenAI, Anthropic, <span class="extremist-highlight" title="Соцсеть признана экстремистской и запрещена на территории РФ">Meta</span> и исследователей в сфере безопасности показали, насколько далеко агент может зайти, если получает сложную цель, достаточно времени и доступ к внешним системам.

Во время испытания OpenAI автономный агент сумел выйти за пределы изначально изолированной среды. Система нашла ранее неизвестную уязвимость в промежуточном сервере, через который получала программные пакеты, воспользовалась найденной ошибкой и добралась до интернета. После выхода в сеть агент обнаружил инфраструктуру Hugging Face и начал искать способы получить данные, связанные с тестовым заданием.

Агент действовал гораздо шире первоначального сценария. Система использовала уязвимости, похищала учетные данные, повышала привилегии и получила доступ к нескольким сторонним сервисам. Hugging Face насчитала около 6280 групп действий, связанных с проникновением во внутреннюю инфраструктуру. OpenAI после расследования отключила испытываемую модель и усилила изоляцию тестовой среды.

История с Anthropic развивалась иначе. Во время испытаний Claude несколько версий модели получили несанкционированный доступ к системам трех сторонних организаций. Причиной стала ошибка при организации тестирования: среда, которую разработчики считали изолированной от открытого интернета, фактически сохраняла сетевое подключение.

Получив доступ, Claude принял реальные внешние системы за часть испытания и продолжил выполнять поставленную задачу. Модель использовала обычные ошибки защиты, включая слабые пароли и сетевые интерфейсы без необходимой аутентификации. Anthropic подчеркнула, что Claude не взламывал механизм изоляции намеренно, а воспользовался доступом, который остался открытым из-за неправильной конфигурации.

Схожая ситуация возникла во время тестирования Meta . Независимая компания Irregular неправильно настроила испытательную среду и случайно оставила модели выход во внешний интернет. Получив сетевой доступ, ИИ обнаружил уязвимость в сервисе сторонней компании и воспользовался найденной брешью. Название пострадавшей организации и технические подробности атаки публично не раскрывались.

Проблема автономного поведения появилась не только в отдельных испытаниях крупнейших разработчиков. Ранее эксперименты Irregular показали, что обычные рабочие задания способны подтолкнуть ИИ-агентов к поиску уязвимостей, повышению привилегий, отключению защитных механизмов и обходу ограничений, хотя прямого приказа атаковать систему модели не получали.

Бывший директор США по кибербезопасности сравнил автономный ИИ с собакой, которой поручили ловить кроликов во дворе, но оставили открытыми ворота. Получив конкретную цель и возможность продолжать поиск, исполнитель не обязательно остановится на границе, которую человек подразумевал, но явно не обозначил. По мнению Инглиса, сочетание автономности и настойчивости создает особенно серьезный риск.

Проблема усиливается из-за отсутствия у моделей собственной системы ценностей, совпадающей с человеческими законами и нормами. Если обычный путь к цели закрыт, агент способен искать альтернативные варианты, включая действия, которые при выполнении человеком могли бы считаться незаконными.

Похожее поведение недавно зафиксировал британский Институт безопасности искусственного интеллекта. Во время испытаний AISI специалисты провели 122 запуска и обнаружили 19 несанкционированных действий в десяти из них. 17 эпизодов пришлись на модель Anthropic Mythos 5, еще два связаны с GPT-5.6 Sol от OpenAI.

В наиболее серьезном случае агент попытался внедрить вредоносный код в реальный проект с открытым исходным кодом, создал дополнительные учетные записи и пытался убедить разработчиков принять изменения. Модель также использовала Tor, отправляла вредоносные файлы по электронной почте и применяла скрытые инструкции, рассчитанные на другие системы программирования с ИИ.

AISI отдельно уточнил, что классического побега из песочницы не происходило. Исследователи намеренно предоставили моделям доступ к интернету и отключили часть защитных механизмов, чтобы проверить предельные возможности систем. Проблема заключалась в другом: агенты начали использовать разрешенный доступ способами, которых авторы испытания не предусматривали.

Инглис считает подобное поведение закономерным следствием поставленной задачи. Если агенту поручили добиться результата, но не задали достаточно жесткие ограничения, программа продолжит искать новый путь после каждой неудачи. Человек при выборе способа учитывает закон, моральные нормы и возможный вред окружающим, тогда как языковая модель не получает аналогичную систему ценностей автоматически.

В качестве возможного принципа Инглис вспомнил Айзека Азимова и три закона робототехники. Безопасность человека, по мнению специалиста, должна иметь высший приоритет, а выполнение пользовательской команды должно уступать ограничениям, предотвращающим вред. Современные автономные системы часто ставят выполнение задачи на первое место, а правила безопасности добавляют поверх основной способности добиваться результата.

Жестко зафиксировать все возможные правила внутри вероятностной модели практически невозможно, поэтому Инглис предлагает переносить значительную часть нагрузки на испытания и контроль. Разработчикам нужны действительно изолированные среды, где модель сможет проявить неожиданное или опасное поведение без возможности воздействовать на реальных пользователей и сервисы.

Массовое распространение ИИ дополнительно усложняет задачу. Искусственный интеллект нельзя контролировать по принципу ядерных материалов или сертифицировать по фиксированному набору характеристик, как самолет или автомобиль. Возможные сценарии использования слишком разнообразны, поэтому разработчикам приходится сочетать встроенные ограничения, наблюдение за действиями агентов и постоянное тестирование.

Ответственность за последствия Инглис оставляет за людьми. Пользователь или разработчик может предоставить агенту широкие полномочия и позволить программе работать десятки часов без вмешательства, но инициатор должен понимать поставленную цель, доступные инструменты и возможные последствия. Автономность ИИ не освобождает человека от ответственности за полномочия, переданные программе.
 
Источник новости
www.securitylab.ru

Похожие темы