Дипфейки Бенчмарк Оценка качества
arXiv cs.SD

MADBench: аудиодипфейки с раздельной подделкой речи и фона

arXiv:2608.09593

MADBench предлагает более реалистичную постановку аудиодипфейков: в видео можно отдельно подделать речь, отдельно фоновую сцену или обе компоненты. Это важный сдвиг от бинарного «аудио настоящее или нет», потому что речь и окружающий звук генерируются разными механизмами и дают разные артефакты. Бенчмарк полезен для проверки, понимает ли detector источник подделки, а не только ловит общий шум синтеза.

Метод. Авторы берут authentic video, генерируют или редактируют speech components и environmental components, а затем собирают протоколы balanced, scene-matched и scene-mismatched. В статистике указано 34 056 сгенерированных речевых компонентов, 24 614 прошедших QC, 22 987 фоновых компонентов и 21 388 прошедших QC. Финальный набор содержит 16 536 audio-visual samples по трем протоколам.

Результаты. Специализированные pretrained audio-visual detectors почти не переносятся: mean AUC для binary any-fake detection находится около 0.518-0.534. Замороженные широкие A-V encoders с легкой головой работают значительно лучше: ImageBind A-V дает mean AUC 0.914, PE-AV Base 0.942, CAV-MAE Sync 0.954. Для четырехклассовой классификации R/S/E/Q PE-AV Base достигает 0.737 accuracy/macro-F1, тогда как zero-shot omni models остаются около chance, примерно 0.25 accuracy.

Ограничения. Данные синтетические и зависят от выбранных генераторов, QC и prompt-правил. Логистические головы на frozen features показывают переносимость признаков, но не заменяют полноценную модель атрибуции. Видео помогает в scene-consistency, но сами авторы отмечают, что direct forensic signal чаще приходит из аудио, поэтому выводы о мультимодальности нужно читать аккуратно.

Фишка из статьи. Компонентная таблица показывает, что фоновая подделка часто легче обнаруживается, чем речевая, и может мешать речевой атрибуции.

СравнениеЧислоЧто означает
CAV-MAE Sync speechAUC 0.849Среднее по компонентной детекции речи
CAV-MAE Sync environmentAUC 0.963Фоновая подделка заметно легче
PE-AV Base speechAUC 0.892Сильный перенос на speech component
PE-AV Base environmentAUC 0.936Еще более сильный сигнал в окружении
Zero-shot omniAUC около 0.49Общие мультимодальные модели не умеют компонентную атрибуцию

Как это читать: оценка дипфейков должна спрашивать не только «fake or real», но и «какая акустическая компонента подделана», иначе модель может выучить неверный источник артефактов.

Оригинальная статья на arXiv