Новости Маленький ИИ говорит «безопасно», большой видит команду. Check Point раскрыла технику PuzzleMask

NewsMaker

I'm just a script
Премиум
29,943
46
8 Ноя 2022
Один и тот же текст оказался безобидным для фильтра и понятной инструкцией для мощной модели.

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
7vb0r8o1ow2zx4gy9wh4ngpl5mb7yqu6.jpg

<div itemprop="articleBody">Маленькая модель читает текст и отвечает «безопасно». Затем тот же текст попадает к более мощному ИИ, который находит внутри скрытую команду и выполняет её. Check Point Research показала такой разрыв на новой технике PuzzleMask, способной обходить быстрые фильтры перед большими языковыми моделями.

PuzzleMask не требует Base64, невидимых символов, эмодзи или подозрительной разметки. Вредоносную инструкцию прячут внутри обычного связного текста, причём внешне запрос может выглядеть совершенно безобидно. Подобные атаки относятся к более широкому классу Prompt Injection , но Check Point нацелилась не на основную модель, а на отдельный ИИ-фильтр, который должен отсеивать опасные запросы до обработки.

Многие сервисы строят защиту по схеме «быстрый фильтр → мощная модель». Небольшой и дешёвый LLM получает запрос первым, классифицирует содержимое как безопасное или опасное и только после проверки передаёт текст более дорогой модели. PuzzleMask использует разницу в вычислительных возможностях двух звеньев. Фильтру не хватает ресурсов, чтобы заметить спрятанную структуру, а сильная модель способна восстановить заложенное сообщение.

Check Point подготовила 23 специальных запроса с командами вроде чтения файла или шифрования документов. GPT-4o-mini, gpt-oss-safeguard:20b и Claude 3 Haiku признали безопасными все 23 проверенных варианта. Llama Guard 3 аналогично пропустила пять запросов, на которых её тестировали. Опасность подобных инструкций особенно возрастает у ИИ-агентов , способных работать с файлами, почтой и другими инструментами.

После прохождения фильтра запросы отправили GPT-5 Thinking High с доступом к интерпретатору Python. Модель извлекла скрытую инструкцию и отреагировала на неё в 17 из 18 испытаний, то есть примерно в 94% случаев. По наблюдениям команды, успешное извлечение требовало около минуты рассуждений и нескольких запусков Python. Такая разница хорошо объясняет, почему быстрый классификатор не замечает того, что затем обнаруживает более мощная система.

Авторы отдельно подчёркивают, что PuzzleMask сама по себе не является jailbreak. Техника лишь доставляет произвольную инструкцию через внешний фильтр, не гарантируя обход встроенных ограничений целевой модели. Однако внутрь PuzzleMask можно поместить уже готовый jailbreak или другую вредоносную команду. Похожую проблему с командами, которые человек почти не замечает, ранее показала атака InkJect , где инструкции прятали внутри изображения.

Для защиты Check Point предлагает перефразировать входящий текст перед передачей основной модели, добавить фильтрам признаки подобных конструкций и контролировать не только входные запросы, но также ответы и действия LLM. В одном эксперименте дополнительное правило позволило GPT-4o-mini обнаружить все 23 подготовленных запроса. Полное исследование PuzzleMask также показывает цену такого подхода: более глубокая проверка увеличивает вычислительные расходы, а жёсткие правила могут давать ложные срабатывания.

Проблема становится особенно заметной там, где модель получает внешние документы и сама решает, какие действия выполнить. Разбор атак на ИИ-агентов показывает тот же фундаментальный риск: данные из сайта, репозитория или письма могут неожиданно превратиться для LLM в инструкцию.

Check Point уже демонстрировала и другой вариант злоупотребления доверием к ИИ-сервисам. В одном из исследований скрытые команды позволяли использовать популярные нейросети как часть канала управления вредоносным ПО. PuzzleMask переносит похожую проблему на уровень самой защитной архитектуры, где слабое звено может находиться не в основной модели, а перед ней.
 
Источник новости
www.securitylab.ru

Похожие темы