Новости Grok 4.5, Gemini, Claude и GPT — в одном тесте. Кто из них рассказал, как сделать оружие массового поражения

NewsMaker

I'm just a script
Премиум
28,743
46
8 Ноя 2022
FAR.AI представила первый рейтинг защищённости языковых моделей от обхода ограничений.

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
1li90sapsjy1spgdv5bs55at057kddjj.jpg

<div itemprop="articleBody">Защита популярных ИИ-моделей от обхода ограничений отличается в десятки и даже сотни раз. Пока одни системы успешно блокируют опасные запросы, другие удаётся сравнительно дёшево заставить выдавать инструкции для кибератак и создания оружия массового поражения. К такому выводу пришли специалисты организации FAR.AI, представившие первый рейтинг защищённости современных языковых моделей.

Авторы отчёта сравнили четыре флагманские модели. Проверку прошли Grok 4.5, Gemini 3.1 Pro, Claude Fable 5 и GPT-5.6 Sol. Специалисты сосредоточились на попытках обойти встроенные ограничения при запросах, связанных с химическим, биологическим, радиологическим и ядерным оружием, взрывчатыми веществами, а также наступательными кибератаками.

Наихудший результат показал Grok 4.5. Во время автоматического поиска удалось обнаружить 63 универсальных способа обхода защиты , а при участии специалистов число выросло до 385. По оценке авторов исследования, поиск одного такого метода обходится примерно в 58 долларов. Gemini 3.1 Pro оказался заметно устойчивее, но также продемонстрировал серьёзные проблемы. Для модели нашли 18 универсальных способов обхода автоматически и 231 при ручном подборе, а средняя стоимость поиска составила около 278 долларов.

Claude Fable 5 и GPT-5.6 Sol, напротив, не позволили обнаружить ни одного универсального способа обхода ни автоматическим поиском, ни при участии специалистов. Авторы подчёркивают, что такой результат не означает абсолютную безопасность, однако говорит о более высокой устойчивости к распространённым методам обхода защитных механизмов.

В FAR.AI также представили собственный минимальный стандарт защиты. По мнению организации, современные модели должны как минимум противостоять широко известным и общедоступным методам обхода. Если разработчик не обеспечивает даже такой уровень защиты, система не соответствует современным требованиям безопасности и может сравнительно легко начать выполнять опасные запросы, связанные с кибератаками или оружием массового поражения.

Авторы объясняют разницу тем, что злоумышленники всегда ищут самое слабое звено. Если одна модель отказывается выполнять опасный запрос, злоумышленник может просто перейти к другой, где ограничения реализованы слабее. По мнению специалистов, разработчикам необходимо использовать сразу несколько независимых уровней защиты, которые проверяют входящие запросы, процесс рассуждений модели и формируемые ответы. Такой подход позволит снизить вероятность успешного обхода ограничений, даже если один из механизмов откажет.
 
Источник новости
www.securitylab.ru

Похожие темы