Почему программа проваливает задачу, но гордо сообщает о триумфе?
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">Автономный ИИ-агент зависит не только от выбранной нейросети : испытания Lasso Security показали, что программная оболочка, которая управляет запросами, инструментами и памятью, способна изменить результат атаки в десятки раз.
Специалисты провели 1000 тестовых атак по методике «красной команды», имитирующей действия злоумышленников. ИИ-модель, инструкции, набор инструментов и цели оставались неизменными. Менялась только исполнительная среда агента. В испытаниях сравнили открытый фреймворк deepagents/LangGraph и закрытый Claude Agent SDK от Anthropic .
Средние показатели успешности у двух систем оказались близкими, но результаты отдельных атак сильно различались. При работе с одной из моделей доля успешных попыток выросла с 1% до 24% после простой замены исполнительной среды. Другие модели при тех же инструкциях начинали лучше справляться с иными типами атак, хотя их собственные параметры не менялись.
Разница возникала из-за того, как программная оболочка собирала запросы, передавала команды инструментам и взаимодействовала с интерфейсом модели. Такие детали определяли, завершит ли агент атаку, остановится на середине или не продвинется дальше первого шага.
Испытания также выявили проблему с самооценкой автономных агентов . Более половины заявленных ими успешных атак оказались ложными срабатываниями после независимой проверки. Агент мог считать задачу выполненной, хотя реального результата не достигал.
Lasso Security пришла к выводу, что популярные испытания ИИ-агентов фактически оценивают не отдельную языковую модель, а связку модели и исполнительной среды. Авторы предлагают указывать обе составляющие в результатах тестов и независимо проверять заявления агентов об успехе.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">Автономный ИИ-агент зависит не только от выбранной нейросети : испытания Lasso Security показали, что программная оболочка, которая управляет запросами, инструментами и памятью, способна изменить результат атаки в десятки раз.
Специалисты провели 1000 тестовых атак по методике «красной команды», имитирующей действия злоумышленников. ИИ-модель, инструкции, набор инструментов и цели оставались неизменными. Менялась только исполнительная среда агента. В испытаниях сравнили открытый фреймворк deepagents/LangGraph и закрытый Claude Agent SDK от Anthropic .
Средние показатели успешности у двух систем оказались близкими, но результаты отдельных атак сильно различались. При работе с одной из моделей доля успешных попыток выросла с 1% до 24% после простой замены исполнительной среды. Другие модели при тех же инструкциях начинали лучше справляться с иными типами атак, хотя их собственные параметры не менялись.
Разница возникала из-за того, как программная оболочка собирала запросы, передавала команды инструментам и взаимодействовала с интерфейсом модели. Такие детали определяли, завершит ли агент атаку, остановится на середине или не продвинется дальше первого шага.
Испытания также выявили проблему с самооценкой автономных агентов . Более половины заявленных ими успешных атак оказались ложными срабатываниями после независимой проверки. Агент мог считать задачу выполненной, хотя реального результата не достигал.
Lasso Security пришла к выводу, что популярные испытания ИИ-агентов фактически оценивают не отдельную языковую модель, а связку модели и исполнительной среды. Авторы предлагают указывать обе составляющие в результатах тестов и независимо проверять заявления агентов об успехе.
- Источник новости
- www.securitylab.ru