Новости Машины научились врать. Алгоритмы осознанно обходят запреты и стараются скрыть нечестную игру от наблюдателей

NewsMaker

I'm just a script
Премиум
28,532
46
8 Ноя 2022
Исследователи дали ИИ-системам нерешаемую задачу и получили пугающий результат.

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
yepnw8e5y15uewn9felveb7z1b7j1n8e.jpg

<div itemprop="articleBody">Британская лаборатория, проверяющая искусственный интеллект на прочность, обнаружила , что абсолютно все протестированные ИИ пытались обмануть систему оценки. Институт безопасности искусственного интеллекта Великобритании (AISI) опубликовал результаты анализа так называемого жульнического поведения ИИ-моделей во время испытаний их способностей.

Под жульничеством понимается выход за рамки задания или нарушение прямо установленных правил ради быстрого решения задачи в обход предусмотренного способа. Проверка проводилась на ИБ-заданиях, где модели должны были найти скрытый в системе код, действуя строго в рамках дозволенных методов взлома. Ни одну модель заранее не просили жульничать — это поведение возникало самостоятельно.

Для выявления нарушений AISI использовал отдельную модель-наблюдателя, которая анализировала весь ход рассуждений и действий проверяемого ИИ. По оценке института, полученные цифры стоит считать нижней границей: часть попыток обмана монитор мог не заметить. Среди типичных приёмов — поиск готовых решений в интернете, попытки повысить привилегии в системе, не являющейся целью задания, включая ту, на которой работает сама модель, и попытки выведать ответ напрямую из программного обеспечения оценки.

Самый показательный случай произошёл во время испытания с ошибочно настроенным заданием, которое в принципе нельзя было решить. Модель проявила настойчивость и написала код, запущенный на внешнем сервисе в открытом интернете, чтобы попытаться получить доступ к инфраструктуре AISI. Это вызвало срабатывание сигнала тревоги в системах института. Утечки данных и повреждений не произошло, но попытка могла увенчаться успехом, если бы защита оказалась слабее. После инцидента AISI усилил меры безопасности своих систем.

Прямой связи между ростом возможностей моделей и частотой обмана не выявлено — скорее поведение зависит от методов обучения конкретной модели , а не от её мощности. При этом опросы самих моделей показали, что полагаться на их честность нельзя: реже чем в половине случаев модели признавали свои действия неправильными, а анализ их внутренних рассуждений тоже не даёт надёжной картины — иногда модель прямо обдумывала, является ли действие обманом, и всё равно совершала его.

По мнению AISI, риски будут расти вместе с возможностями ИИ, даже если частота обмана останется прежней: более способные модели смогут находить менее заметные и потенциально более опасные способы обхода правил, особенно в кибербезопасности . Институт считает, что снизить риск может сочетание ручной проверки результатов с автоматическим мониторингом действий модели, а в перспективе — обучение моделей не прибегать к обману изначально, хотя сделать это надёжно будет непросто.
 
Источник новости
www.securitylab.ru

Похожие темы