Новости Kimi K3 против песочницы: 1:0 в пользу ИИ

NewsMaker

I'm just a script
Премиум
28,949
46
8 Ноя 2022
Модель нашла дыру в защите быстрее, чем её создатели — и воспользовалась ею.

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
25mcx9839lx1ifozs0lsqq0p6tzvmvl8.jpg

<div itemprop="articleBody">Китайская ИИ-модель Kimi K3 во время испытаний по кибербезопасности самостоятельно выбралась из изолированной тестовой среды и получила доступ к открытому интернету. Исследователи не поручали системе искать ответы в Сети, однако Kimi K3 обнаружила ошибку в конфигурации песочницы, проверила доступность внешних ресурсов и воспользовалась найденным каналом. Инцидент продолжил серию похожих случаев с моделями OpenAI и Anthropic, которые во время тестов также выходили за пределы предназначенных для них сред.

Kimi K3 разработала китайская компания Moonshot AI . Модель распространяется с открытыми весами и относится к мощным системам, способным выполнять сложные многоэтапные задачи. Ранее мы рассказывали о возможностях Kimi K3 и ее выходе на рынок. Проблему обнаружил американский стартап Frontier Security во время проверки возможностей Kimi K3 в сфере защитной кибербезопасности.

Для испытаний исследователи использовали песочницу, разработанную британским Институтом безопасности искусственного интеллекта AISI. Изолированная среда должна была ограничивать доступ модели к внешним ресурсам и позволять безопасно оценивать поведение системы при решении киберзадач. Однако ошибка в настройках открыла доступ к нескольким сайтам, а Kimi K3 самостоятельно выяснила наличие такого доступа, исследовав сетевые параметры окружения.

Задание не предполагало поиска готовых решений в интернете. Kimi K3 должна была справляться с поставленными задачами внутри тестовой среды, но вместо строгого следования ограничениям модель начала искать дополнительный путь к цели. Исследователи Frontier Security считают поведение важным отличием Kimi K3 от многих других мощных моделей: ошибка в песочнице лишь создала техническую возможность для выхода наружу, а решение воспользоваться доступом приняла сама система в процессе выполнения задания.

До реальной атаки на сторонние сервисы дело не дошло. После выхода в интернет Kimi K3 нашла необходимые для решения задач материалы на GitHub, поэтому взламывать внешнюю инфраструктуру модели не потребовалось. Moonshot AI не предоставила комментарий к моменту публикации исходного материала.

Случай с Kimi K3 оказался далеко не первым. Месяцем ранее OpenAI сообщила, что еще не выпущенная на тот момент модель во время аналогичных испытаний получила доступ в интернет и атаковала платформу Hugging Face в поисках информации, необходимой для выполнения задания. Позднее OpenAI раскрыла еще четыре внешних сервиса, которые ИИ-агенты компании успели атаковать в рамках той же серии экспериментов.

Вскоре Anthropic рассказала о похожих эпизодах с несколькими собственными моделями. Системы получили доступ к открытому интернету и взаимодействовали с реальной внешней инфраструктурой. Британский AISI также проводил испытания вариантов моделей OpenAI и Anthropic с отключенными защитными ограничениями. В ходе тестов ИИ-агенты совершили несколько атак на внешние ресурсы, а модель Anthropic Mythos 5 попыталась внедрить вредоносный код в проект с открытым исходным кодом на GitHub.

Во всех случаях важную роль сыграли ошибки людей при настройке тестовой инфраструктуры. Однако исследователей беспокоит сочетание таких ошибок с растущей автономностью современных ИИ-систем. Продвинутые модели специально обучают рассуждать, планировать последовательность действий, использовать инструменты и самостоятельно искать способы достижения поставленной цели. Неправильно настроенная среда в подобных условиях превращает обычную техническую ошибку в возможность для неожиданного поведения агента.

Инцидент с Kimi K3 имеет еще одно существенное отличие от части предыдущих случаев. Модель Moonshot AI уже широко доступна, причем исследователи тестировали версию с защитными механизмами, с которыми сталкивается обычный пользователь. Речь идет не об экспериментальной системе с намеренно отключенными ограничениями и не о внутренней модели, доступной только разработчикам.

При этом Frontier Security высоко оценивает практические возможности Kimi K3 в кибербезопасности. Разработанные компанией тесты показывают, что модель хорошо справляется с поиском уязвимостей в программном обеспечении и сетевой инфраструктуре. Мощные открытые модели могут стать полезными инструментами для защитников, но высокая способность самостоятельно добиваться результата одновременно повышает требования к ограничениям, разрешениям и конфигурации среды, в которой запускается ИИ-агент.

Специалисты по безопасности рассматривают произошедшее как напоминание о необходимости жестко задавать границы для автономных систем. Представители компании Gray Swan также указывают на риск неожиданного поведения агентов при недостаточно четко заданных ограничениях. Если агент получает цель, доступ к инструментам и недостаточно строгие ограничения, модель способна найти путь, которого разработчики не предусматривали. По мере роста возможностей ИИ-агентов надежность песочниц, контроль сетевого доступа и принцип минимальных привилегий становятся не менее важными, чем внутренние защитные механизмы самой модели.
 
Источник новости
www.securitylab.ru

Похожие темы