Новости Вы видите приглашение, ИИ — приказ. Хакеры переманивают нейросети на свою сторону в новой атаке PromptSpy

NewsMaker

I'm just a script
Премиум
28,987
46
8 Ноя 2022
Входные данные для алгоритмов оказались куда шире привычного содержимого экрана.

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
g4fl0so1l2wmh0wn4hcipo9erwq56gpi.jpg

<div itemprop="articleBody">Фишинговое письмо больше не обязано убеждать человека, если рядом работает ИИ-помощник. Forcepoint показала в исследовательской симуляции PromptSpy, как скрытая инструкция внутри обычного письма может повлиять на нейросеть, которая автоматически читает почту, делает сводку и готовит ответ. Человек при этом видит лишь нормальное приглашение на конференцию.

PromptSpy моделирует цепочку из нескольких ИИ-агентов. Один создаёт личность отправителя, другой собирает профиль получателя, третий выбирает подходящий предлог, а четвёртый пишет письмо. После доставки пути расходятся: получатель читает видимый текст, а почтовый ИИ получает более широкий контекст сообщения и обрабатывает его как данные для следующего шага.

В демонстрации атакующий прячет директиву, которая требует игнорировать прежние правила, считать отправителя доверенным, убрать предупреждение о фишинге и добавить призыв перейти по ссылке. PromptSpy показывает несколько вариантов размещения инструкции: обычный текст, скрытые HTML-блоки, поддельные маркеры ролей «system» и «assistant», а также невидимые символы Unicode.

Расчёт строится на разнице между тем, что воспринимает человек, и тем, что получает модель. Белый текст на белом фоне, блок с display:none или служебная конструкция могут не попасть в поле зрения пользователя, но остаться во входных данных ИИ. Поддельные разделители рассчитаны на то, чтобы модель приняла фрагмент письма за системную команду, а не за содержимое сообщения.

Forcepoint подчёркивает, что PromptSpy не показывает готовую реальную атаку и не выполняет произвольные инструкции. Проект сравнивает защищённый режим с симуляцией, где дополнительный контекст может менять реакцию следующего ИИ-агента . Главный риск связан с цепочками из нескольких агентов: одна обработанная строка может попасть в сводку, черновик ответа или дальнейшее действие другого компонента.

Чтобы снизить такой риск, разработчики советуют проверять данные между агентами, очищать промежуточный контекст, отслеживать происхождение инструкций и изолировать память диалога. Дополнительно стоит ограничивать срок хранения контекста, проверять обмен между агентами и следить за неожиданными изменениями поведения на разных этапах цепочки ИИ-систем.
 
Источник новости
www.securitylab.ru

Похожие темы