Новости Нейросеть смотрит на лодку — и слышит плеск воды, которого нет. Учёные придумали, как отучить её от галлюцинаций

NewsMaker

I'm just a script
Премиум
28,833
46
8 Ноя 2022
Чем больше чувств у машины, тем больше она фантазирует.

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/676;margin-bottom:2rem;overflow:hidden">
7onm0qic6d6yatc1w1ueweq8xoradpxh.jpg

<div itemprop="articleBody">Искусственный интеллект может одновременно анализировать изображение, звук и текст, но несколько источников информации не всегда делают ответ точнее. Иногда обычная видеокамера заглушает данные тепловизора, а увиденный предмет заставляет модель «услышать» звук, которого в записи нет. Два новых метода помогают разделять сигналы и не давать одной сенсорной системе подменять другую.

Мультимодальные большие языковые модели получают данные сразу в нескольких формах. Они могут описывать видеозапись, отвечать на вопросы о звуковой дорожке, читать документы, разбирать медицинские снимки и сопоставлять показания разных датчиков. Каждую разновидность входных данных в машинном обучении называют модальностью.

При совместном анализе модель ищет связи между модальностями. Полезный механизм одновременно создаёт источник ошибок. Нейросеть привыкает, что лодка на видео часто сопровождается плеском воды, а работающий двигатель обычно шумит. Увидев знакомый объект, система иногда добавляет ожидаемый звук, хотя микрофон ничего такого не записал.

Ошибка работает и в обратную сторону. Аудиозапись может подтолкнуть модель к описанию предмета или события, которого нет в кадре. Исследователи называют такие выдумки межмодальными галлюцинациями: информация из одного канала незаметно вмешивается в анализ другого.

Отдельная проблема возникает при работе со специальными камерами. Большинство мультимодальных моделей обучают прежде всего на обычных цветных снимках RGB, где каждый пиксель содержит сведения о красной, зелёной и синей составляющих света. После такой подготовки нейросеть переносит привычные правила на изображения, созданные совсем другими физическими процессами.

Яркое пятно на обычной фотографии может означать блик или хорошо освещённую поверхность. На тепловом изображении яркость обычно связана с интенсивностью инфракрасного излучения и температурой. Модель, привыкшая к RGB-кадрам, способна принять нагретый участок за отражение света и неверно описать состояние объекта.

Камеры глубины тоже не показывают привычную фотографию. Значение пикселя кодирует расстояние от прибора до поверхности, поэтому светлая и тёмная области могут обозначать близкие и далёкие предметы. Рентгеновский снимок отражает степень прохождения излучения через материалы и ткани. Цветовые привычки, усвоенные на обычных изображениях, здесь только мешают.

Для обучения работе с такими данными разработали метод Diverse Negative Attributes, сокращённо DNA. Название можно перевести как оптимизацию на разнообразных ошибочных признаках. Модели показывают не только правильные ответы, но и характерные заблуждения, которые возникают при анализе разных сенсоров.

Если нейросеть принимает горячую область за световой блик, ошибочное объяснение становится отрицательным примером. Алгоритм учится отличать физический смысл теплового сигнала от визуальных признаков обычной фотографии. Аналогичным способом корректируют восприятие карт глубины и рентгеновских изображений.

Для проверки метода создали набор тестов VS-TDX. Он объединяет данные обычных, тепловых, глубинных и рентгеновских камер и позволяет оценить, понимает ли модель особенности каждого прибора. Авторы называют VS-TDX первым комплексным бенчмарком, ориентированным на столь разные зрительные сенсоры.

DNA требует дополнительной настройки модели, но не предполагает полного обучения с нуля. Для корректировки достаточно сравнительно небольшого набора примеров, в которых отмечены правильные свойства сигнала и типичные ошибочные трактовки. Такой подход снижает затраты на вычисления и помогает адаптировать уже существующую систему к новому оборудованию.

После настройки модель точнее определяет состояние объектов в темноте, дыму и других условиях, где обычная камера видит мало. Тепловизор продолжает различать нагретые поверхности при слабом освещении, а алгоритм перестаёт объяснять полученную картину законами видимого света.

Второй метод решает другую задачу и не требует дополнительного обучения. Modality-Adaptive Decoding, или MAD, управляет моделью непосредственно во время формирования ответа. Перед анализом система оценивает, какие данные важнее для конкретного вопроса: изображение, звук или их сочетание.

Если пользователя интересует шум двигателя, алгоритм усиливает влияние аудиозаписи и ослабляет визуальные догадки. При вопросе о цвете машины приоритет получает изображение. Когда для ответа нужны оба канала, система учитывает их совместно, но старается не переносить сведения из одного источника в другой без подтверждения.

MAD использует отдельные ветви декодирования для разных модальностей и динамически назначает им вес. Затем результаты сравниваются при выборе следующих слов ответа. Нерелевантный канал влияет слабее, поэтому лодка в кадре уже не заставляет модель автоматически сообщать о плеске, если на звуковой дорожке слышна тишина.

Метод проверили на аудиовизуальных моделях VideoLLaMA2-AV и Qwen2.5-Omni с помощью тестов CMM и AVHBench. В зависимости от модели и набора заданий точность выросла на 2–8,7 процентного пункта. При этом MAD сохранял качество ответов на обычные вопросы, не связанные напрямую с галлюцинациями. Работа принята на конференцию CVPR 2026 и доступна в открытом архиве.

Главное преимущество MAD связано с отсутствием переобучения. Метод можно подключить к уже готовой модели на этапе генерации текста. Разработчикам не приходится заново собирать крупный набор данных и запускать дорогое обучение, чтобы уменьшить влияние ложных связей между звуком и изображением.

DNA и MAD работают на разных уровнях. Первый метод объясняет нейросети, что именно измеряет каждый сенсор, и исправляет привычку трактовать все изображения как обычные фотографии. Второй контролирует смешивание уже распознанных сигналов и не позволяет одной модальности диктовать ответ о другой.

Такая комбинация особенно полезна для автономного транспорта . Ночью или в тумане машина может одновременно использовать обычные камеры, тепловизоры, радары и датчики глубины. Ошибка в физическом смысле сигнала приведёт к неправильному распознаванию препятствия, а путаница между каналами способна убедить систему, что один датчик подтвердил вывод другого, хотя подтверждения не было.

Похожая задача возникает у роботов, которые работают в задымлённых зданиях. Обычная камера почти теряет обзор, тогда как тепловой сенсор продолжает показывать людей и горячие предметы. Модель должна понимать происхождение ярких областей и не дополнять показания вымышленными деталями из визуальных шаблонов.

Разработчики также рассматривают беспилотники с тепловизорами, досмотровые рентгеновские установки в аэропортах и системы анализа медицинских изображений . Во всех случаях ошибка связана не только с распознаванием объекта. Алгоритму необходимо правильно истолковать физический сигнал и честно отделить наблюдаемое от предположения.

Новые методы не устраняют все галлюцинации мультимодальных моделей. DNA зависит от качества примеров для каждого вида сенсора, а MAD опирается на способность самой системы оценить важность входных каналов. Однако обе работы показывают практичный путь: вместо полного переобучения можно отдельно исправлять сенсорные привычки модели и контролировать влияние изображения, звука и других данных в момент ответа.
 
Источник новости
www.securitylab.ru

Похожие темы