Новости Ваш начальник – подделка? Новая защитная система предупредит об этом прямо на созвоне

NewsMaker

I'm just a script
Премиум
28,831
46
8 Ноя 2022
Zoom сам маскирует следы дипфейков, когда сжимает видео и звук. Теперь мы знаем, как с этим бороться.

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/676;margin-bottom:2rem;overflow:hidden">
qxq382ubirwziwbjznt4q4kiscl157m3.jpg

<div itemprop="articleBody">Привычный видеозвонок больше не гарантирует, что на экране находится реальный человек. Современные дипфейки уже умеют подменять лицо и голос в реальном времени, поэтому преступники могут собрать целую виртуальную встречу из искусственно созданных участников. Мошеннический сценарий особенно опасен для компаний, где сотрудники согласуют платежи, обсуждают сделки и обмениваются конфиденциальной информацией через Zoom, Teams и другие сервисы видеосвязи.

В 2025 году финансовый директор компании из Сингапура подключился к звонку в Zoom, где увидел руководителя и нескольких коллег. Все участники конференции оказались цифровыми подделками. Преступники убедили сотрудника перевести около 500 тысяч долларов. Позднее власти смогли вернуть деньги, но случай показал, насколько правдоподобно генеративные технологии воспроизводят знакомые лица, голоса и манеру общения.

Количество подобных атак быстро растёт. Агентство кибербезопасности Сингапура зарегистрировало более 1200 случаев видеомошенничества только за январь 2026 года. За тот же месяц 2025 года ведомство получило 43 сообщения. Проблема давно вышла за пределы одной страны. Авторы отчёта Entrust Identity Fraud Report за 2026 год изучили более миллиарда случаев по всему миру и пришли к выводу, что мошенничество с личностью превратилось в организованный и коммерчески отлаженный бизнес.

Распознавать поддельных участников видеоконференции сложнее, чем проверять заранее записанный ролик. Качество изображения и звука постоянно меняется из-за скорости соединения. Сервисы сжимают видеопоток, чтобы разговор не прерывался, и вместе с лишними данными удаляют мелкие дефекты изображения, по которым старые детекторы находили монтаж. Автоматическое размытие фона, плохое освещение, шум, движение за спиной собеседника и рывки картинки создают дополнительные помехи.

Обычный детектор может принять последствия слабого интернета за признаки дипфейка. Частые ложные тревоги сделают защиту бесполезной: участники перестанут реагировать на предупреждения или отключат проверку. Система должна отличать цифровую подмену от артефактов, которые регулярно возникают во время настоящих звонков.

Для решения задачи разработали программу, которая одновременно анализирует видео и звук. Алгоритм непрерывно оценивает вероятность подделки во время разговора и показывает предупреждение, если замечает сразу несколько подозрительных признаков. Программа не выносит окончательный вердикт и не блокирует встречу. Получив сигнал, участник должен проверить собеседника: задать вопрос, ответ на который сложно подготовить заранее, или связаться с человеком по другому каналу.

Проверка работает прямо на компьютере пользователя. Изображение и звук не нужно отправлять на внешний сервер, поэтому конфиденциальные разговоры не покидают корпоративную инфраструктуру. Для обработки видеопотока в реальном времени достаточно производительного ноутбука с современной видеокартой и 12 ГБ видеопамяти.

Локальный режим подходит для заседаний руководства, работы финансовых отделов и переговоров с внешними партнёрами. Компании могут подключить детектор к сервису видеосвязи в виде отдельного модуля либо встроенной функции. Другой вариант предусматривает защищённый корпоративный сервер, через который проходят только встречи с повышенными требованиями к безопасности. Конкретная схема зависит от вычислительных ресурсов, правил обработки персональных данных и характера обсуждаемой информации.

Классические методы обработки сигналов плохо справились с проверкой в реальном времени. Анализ отдельных частот, шумов и визуальных искажений требует много вычислений и быстро теряет точность после сжатия данных. Машинное обучение обрабатывает поток быстрее и находит сочетания признаков, которые трудно описать вручную.

Алгоритм обучали на настоящих и поддельных аудио- и видеозаписях. Для работы со звуком использовали открытые наборы данных, куда вошли около 19 тысяч реальных записей и примерно 160 тысяч изменённых. Подделки включали искусственные голоса и другие способы имитации речи.

Чистые студийные записи плохо подходят для обучения детектора видеоконференций. В реальном звонке голос прерывается, изображение теряет резкость, фон размывается, а программа меняет степень сжатия при нестабильном соединении. Поэтому разработчики намеренно ухудшали учебные материалы: добавляли шум, снижали качество, имитировали размытие и другие помехи. В машинном обучении такой способ подготовки данных называют аугментацией.

Аугментация учит систему не реагировать на каждый дефект как на атаку. Алгоритм видит один и тот же материал в разных условиях и постепенно отделяет обычные последствия передачи данных от признаков синтетического лица или голоса. Без подобной подготовки детектор хорошо работал бы на тестовых записях, но ошибался во время обычных рабочих встреч.

Для проверки не потребовалась крупная универсальная модель, способная писать тексты или отвечать на вопросы. Разработчики создали специализированную нейросеть для одной задачи, поэтому обучение заняло меньше ресурсов. При подготовке экспериментов генерация достаточно убедительных дипфейков потребовала больше времени, чем настройка системы для их распознавания в реальном времени.

Программа пока остаётся экспериментальным прототипом. Следующий этап включает испытания в корпоративных сетях и интеграцию с платформами видеосвязи. Разработчикам предстоит проверить нагрузку на оборудование, удобство предупреждений и точность работы при разных камерах, микрофонах и скоростях соединения.

Отдельного решения требуют юридические вопросы. Организациям нужно определить, должны ли участники заранее соглашаться на автоматический анализ голоса и изображения. Поставщикам видеосвязи также придётся указать функцию в правилах использования и объяснить, какие данные обрабатывает детектор и где хранятся результаты проверки.

Техническое распознавание не сможет полностью закрыть угрозу. Дипфейки могут добраться до процедур, которые банки используют для дистанционного подтверждения личности. Снизить риск помогают криптографическая защита, дополнительная аутентификация и заранее прописанные правила для опасных операций.

Итак, запоминаем раз и навсегда: запрос на перевод денег во время видеозвонка нельзя подтверждать только потому, что распоряжение произнёс знакомый голос с экрана. Сотрудник должен связаться с отправителем через независимый канал, например по известному номеру телефона или через корпоративную систему согласования. Детектор предупредит о возможном риске, но окончательную защиту обеспечит процедура, которая не позволяет одному видеозвонку запустить платёж.
 
Источник новости
www.securitylab.ru

Похожие темы