MADBench: аудиодипфейки с раздельной подделкой речи и фона
MADBench предлагает более реалистичную постановку аудиодипфейков: в видео можно отдельно подделать речь, отдельно фоновую сцену или обе компоненты. Это важный сдвиг от бинарного «аудио настоящее или нет», потому что речь и окружающий звук генерируются разными механизмами и дают разные артефакты. Бенчмарк полезен для проверки, понимает ли detector источник подделки, а не только ловит общий шум синтеза.
Метод. Авторы берут authentic video, генерируют или редактируют speech components и environmental components, а затем собирают протоколы balanced, scene-matched и scene-mismatched. В статистике указано 34 056 сгенерированных речевых компонентов, 24 614 прошедших QC, 22 987 фоновых компонентов и 21 388 прошедших QC. Финальный набор содержит 16 536 audio-visual samples по трем протоколам.
Результаты. Специализированные pretrained audio-visual detectors почти не переносятся: mean AUC для binary any-fake detection находится около 0.518-0.534. Замороженные широкие A-V encoders с легкой головой работают значительно лучше: ImageBind A-V дает mean AUC 0.914, PE-AV Base 0.942, CAV-MAE Sync 0.954. Для четырехклассовой классификации R/S/E/Q PE-AV Base достигает 0.737 accuracy/macro-F1, тогда как zero-shot omni models остаются около chance, примерно 0.25 accuracy.
Ограничения. Данные синтетические и зависят от выбранных генераторов, QC и prompt-правил. Логистические головы на frozen features показывают переносимость признаков, но не заменяют полноценную модель атрибуции. Видео помогает в scene-consistency, но сами авторы отмечают, что direct forensic signal чаще приходит из аудио, поэтому выводы о мультимодальности нужно читать аккуратно.
Фишка из статьи. Компонентная таблица показывает, что фоновая подделка часто легче обнаруживается, чем речевая, и может мешать речевой атрибуции.
| Сравнение | Число | Что означает |
|---|---|---|
| CAV-MAE Sync speech | AUC 0.849 | Среднее по компонентной детекции речи |
| CAV-MAE Sync environment | AUC 0.963 | Фоновая подделка заметно легче |
| PE-AV Base speech | AUC 0.892 | Сильный перенос на speech component |
| PE-AV Base environment | AUC 0.936 | Еще более сильный сигнал в окружении |
| Zero-shot omni | AUC около 0.49 | Общие мультимодальные модели не умеют компонентную атрибуцию |
Как это читать: оценка дипфейков должна спрашивать не только «fake or real», но и «какая акустическая компонента подделана», иначе модель может выучить неверный источник артефактов.