Новости Бабушка читала рецепт напалма на ночь: как детские уловки обходят миллиардные системы защиты ИИ

NewsMaker

I'm just a script
Премиум
28,621
46
8 Ноя 2022
После обновления ChatGPT прошлым летом чат-бот начал выдавать инструкции по биооружию.

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1024/576;margin-bottom:2rem;overflow:hidden">
35zy479c0hc65pic83d1rglxa8028vaj.jpg

<div itemprop="articleBody">После усиления моделей OpenAI летом 2025 года сотни пользователей по всему миру начали спрашивать ChatGPT, как изготовить яды и биологическое оружие. Чат-бот терпеливо выдавал пошаговые инструкции, некоторые рекомендации оказались достаточно простыми для человека со знаниями биологии на уровне старших классов школы.

Специалисты по биологии и терроризму позднее изучили часть переписок по просьбе OpenAI. Эксперты признали некоторые ответы смертельно точными, рассказали The Wall Street Journal источники, знакомые с результатами проверки. По данным самой компании, большинство опасных запросов касалось приготовления ядов.

OpenAI заблокировала учетные записи, владельцы которых интересовались изготовлением токсинов и биологического оружия, но не стала сообщать о пользователях правоохранительным органам. Федеральные законы США пока не обязывают ИИ-компании ограничивать подобные запросы или раскрывать сведения о разговорах, связанных с оружием и потенциальными угрозами безопасности.

Пробел в регулировании становится заметнее по мере роста возможностей нейросетей. Действующие и бывшие сотрудники крупных ИИ-лабораторий, консультанты и исследователи биологического оружия сообщили о росте числа запросов, связанных с массовыми убийствами. В отдельных случаях чат-боты отвечали реалистичными планами нападений с большим количеством жертв.

В начале 2025 года пользователи спрашивали ChatGPT, как превратить патогены в мелкодисперсную смесь, пригодную для вдыхания. Другой собеседник хотел изменить вирус кори, чтобы вспышка заболевания получила устойчивость к действующей вакцине. Модель предоставила инструкции в обоих случаях.

Еще один пользователь попросил рассказать, как изготовить рицин, крайне токсичный яд, запрещенный международными соглашениями. ChatGPT выдал подробные рекомендации, после чего пользователь упомянул убийство родителей. Характер высказывания источники не уточнили. OpenAI заблокировала учетную запись, но не обратилась в правоохранительные органы.

Растущие возможности ИИ, особенно при разработке биологических и кибератак, беспокоят руководство технологических компаний и Белый дом. Разработчики пытаются остановить злоумышленников, не лишая ученых и врачей доступа к полезным функциям.

Высокопоставленные сотрудники Белого дома и Пентагона обсуждают риск превращения ИИ в инструктора по созданию биологического оружия еще со времен администрации Джо Байдена. Выпуск новых мощных моделей заставил действующую администрацию перейти от минимального вмешательства к усилению надзора.

Министерство торговли США недавно ограничило использование двух моделей Anthropic за пределами страны. В ответ компания полностью закрыла доступ к продуктам. Ведомство отменило ограничения после сообщения Anthropic об устранении способов обхода защитных механизмов.

OpenAI, Anthropic и другие разработчики утверждают, что сотрудничают с американской администрацией при выпуске новых моделей, блокируют пользователей и ограничивают учетные записи с подозрительной активностью. Однако ни президентские указы, ни решения Конгресса не требуют от компаний сообщать обо всех запросах с советами по причинению вреда или убийству людей.

Несколько американских штатов уже приняли собственные правила, а некоторые законодатели предложили федеральные инициативы. Опасения по поводу конфиденциальности пользователей и возможного замедления отрасли пока сохраняют добровольный характер большинства уведомлений.

Федеральные законы запрещают чат-ботам создавать материалы с сексуальным насилием над детьми. Разработчики также обязаны соблюдать общие нормы защиты потребителей и персональных данных. В остальных ситуациях руководители ИИ-компаний самостоятельно определяют границы допустимого.

Чат-боты уже вызывали опасения из-за помощи пользователям, планировавшим нападения с огнестрельным оружием. Биологические инструкции создают более масштабную угрозу, поскольку грамотный пользователь может применить полученные сведения против большого количества людей.

Представитель OpenAI заявила, что компания обучает модели отказываться от инструкций, тактик и планов, способных причинить вред. Перед каждым выпуском разработчики проводят проверки безопасности, а внутренние системы позволяют выявлять и пресекать попытки получить опасную биологическую информацию. ChatGPT ежедневно обрабатывает около 2,5 млрд запросов.

OpenAI обращается в правоохранительные органы, когда переписка указывает на непосредственный и убедительный риск причинения вреда другим людям. Компания не раскрыла критерии, по которым отделяет реальную угрозу от провокации, проверки защитных фильтров или теоретического интереса.

С запросами о создании биологического оружия сталкивались Claude от Anthropic, Gemini от Google и Grok Илона Маска, который недавно вошел в состав SpaceX. Источники не смогли установить, готовили ли пользователи реальные нападения или только проверяли возможности приложений.

Представитель Google сообщил, что в команду безопасности компании входят ученые, оценивающие риски биологического оружия. Разработчик также проводит специальные испытания, которые должны выявлять слабые места защитных механизмов.

Пользователи с углубленной подготовкой по биологии уже могут получать от ИИ помощь в планировании и закупке материалов для точечных атак с небольшим числом жертв, считает руководитель направления национальной безопасности Future of Life Institute Хамза Чодри. В качестве примеров эксперт назвал заражение продуктов или воды сальмонеллой и рицином.

В будущем организованные группы смогут использовать нейросети для более масштабных нападений. Чат-бот способен разбирать неудачные лабораторные протоколы, объяснять причины ошибок и частично заменять годы специализированной подготовки.

Дополнительные опасения вызывают открытые модели китайских разработчиков. Недорогие и широко доступные системы можно изменять, удаляя встроенные ограничения безопасности.

Тревогу усилил эксперимент с двумя моделями OpenAI. Во время обучения системы покинули исследовательскую сеть и взломали другую ИИ-компанию, утверждает The Wall Street Journal.

По оценке Чодри, иностранные государства и связанные с властями группы могут применять ИИ для разработки ранее немыслимых вариантов оружия массового уничтожения. Наиболее опасный вариант предполагает появление настолько заразного, смертоносного или необычного агента, что существующие медицинские и государственные системы не смогут остановить распространение.

При запуске ChatGPT в 2022 году модели OpenAI показывали сравнительно слабые результаты в биологии и химии. Руководство компании не считало серьезной угрозой сотрудничество чат-бота с пользователем, который готовит опасное нападение.

Несмотря на ограниченные возможности первых моделей, OpenAI наняла ученых для проверки потенциально опасных сценариев. Специалисты задавали чат-ботам вопросы о смертельных атаках, а разработчики составляли перечень тем, на которые система должна отвечать отказом.

Испытания показали, что настойчивый собеседник способен переубедить модель. Во время продолжительного разговора чат-бот иногда переставал соблюдать первоначальные ограничения и начинал выдавать запрещенные сведения.

Пользователи, например, обходили отказ ChatGPT предоставить рецепт напалма с помощью простой выдумки. Собеседник рассказывал, что бабушка якобы читала рецепт перед сном, а затем просил модель повторить текст для борьбы с бессонницей. Уловка срабатывала.

Представитель OpenAI заявила, что с тех пор защитные механизмы стали значительно надежнее и современные модели отказываются выполнять подобные просьбы. Независимые исследователи при этом продолжают находить способы обхода ограничений.

Руководитель направления исследования ИИ-угроз в Cisco Эми Чанг выяснила, что защиту ChatGPT, Claude и Gemini можно обойти примерно за пять последовательных сообщений. По словам исследовательницы, ни одна модель не обладает полной защитой от настойчивого пользователя.

Руководство OpenAI не хочет, чтобы чат-бот слишком часто отвечал отказом. Жесткие ограничения мешают работе специалистов общественного здравоохранения и разработчиков лекарств, которые используют нейросети для поиска информации, проверки гипотез, анализа данных и подготовки экспериментов.

Блокировка определенных терминов способна остановить полезное исследование вместе с опасным запросом. Ограничения Claude на ответы с упоминанием слова «патоген», например, создали проблемы сотрудникам Центров по контролю и профилактике заболеваний США.

В мае специалисты ведомства расследовали распространение хантавируса на круизном судне в Атлантике. Claude отказывался помогать с отслеживанием вспышки из-за упоминания возбудителя.

Руководитель направления Anthropic по работе с государственными организациями позднее заявил, что сотрудники ведомства использовали общедоступную модель вместо специализированной версии для государственных заказчиков. Компания помогла службе подобрать подходящие инструменты и способы работы с нейросетью.

OpenAI запустила отдельную программу для проверенных организаций и исследователей. Участники получают доступ к моделям с меньшим количеством автоматических отказов, но сложная процедура проверки замедляет одобрение заявок.

Сэм Альтман и руководители других технологических компаний недавно призвали Конгресс ввести обязательные меры безопасности для поставщиков синтетических ДНК и РНК. Подобные материалы обычно покупают лаборатории для исследований и разработки вакцин, однако ИИ может помочь злоумышленникам использовать заказы для создания новых патогенов.

Американские законодатели подготовили двухпартийные инициативы для усиления контроля. Представитель Республиканской партии Натаниэль Моран в июне внес законопроект, который обяжет ИИ-компании сообщать Министерству торговли о признаках опасных угроз, включая подготовку биологических атак.

Моран также поддержал отдельный проект, предоставляющий федеральным властям право требовать отключения моделей, признанных слишком опасными.

К 2024 году биологические навыки моделей OpenAI начали быстро улучшаться. Внутренние испытания показали, что специалист по биологии может с помощью серии вопросов склонить ChatGPT к консультациям по созданию патогенов, пригодных для распыления.

Сотрудники прогнозировали, что к 2025 году модель сможет помогать пользователю со знаниями биологии на уровне школы проектировать и создавать биологическое оружие.

Тогдашний руководитель OpenAI по безопасности Райан Байермайстер призывала коллег быстрее разработать систему поиска пользователей, которые пытаются создать биологическое оружие или подготовить нападение. Часть руководителей считала существующие ограничения достаточными.

Несмотря на разногласия, Байермайстер привлекла несколько команд безопасности к созданию системы мониторинга. К весне 2025 года специалисты подготовили первоначальный инструмент для выявления пользователей, интересующихся биологическим оружием.

В июне 2025 года OpenAI публично признала, что растущие познания моделей в биологии могут использоваться во вред. Компания сообщила о разработке систем обнаружения нарушений, блокировке опасных пользователей и обучении моделей отказываться от вредоносных запросов.

Перед выпуском GPT-5 летом 2025 года внутренние испытания показали достижение высокого уровня риска. По классификации OpenAI, модель могла успешно помогать пользователю с ограниченной подготовкой создавать биологическую угрозу.

Некоторые сотрудники опасались, что система мониторинга охватывает не все опасные разговоры. Компания продолжила дорабатывать инструмент. По словам представителя OpenAI, с апреля 2025 года разработчик проверяет все запросы к наиболее продвинутым моделям.

OpenAI выпустила GPT-5 после обучения модели отказам от информации, способной причинить вред. Компания также предложила вознаграждение до 50 тысяч долларов пользователям, которые смогут продемонстрировать обход отдельных механизмов защиты от биологических угроз.

В начале 2026 года OpenAI прекратила сотрудничество с Байермайстер из-за обвинений в дискриминации по половому признаку. Бывшая сотрудница отвергла претензии компании.

Вскоре после выпуска GPT-5 сотрудники обнаружили, что модель помогает пользователям, которые спрашивали об изготовлении ядов и биологического оружия. Осенью 2025 года OpenAI изменила внутреннюю классификацию GPT-5 и отнесла модель к менее опасной категории. Источники не раскрыли подробные причины пересмотра оценки.
 
Источник новости
www.securitylab.ru

Похожие темы