Детекция дипфейков XLS-R Robustness
Детекция дипфейков

Детекция fake audio: тишина помогает in-domain и вредит переносу

ITW EER 6.90%

Эта статья ценна тем, что показывает неочевидную ловушку детекции поддельного аудио: отличный результат на ASVspoof может плохо переноситься на реальные записи in-the-wild. Авторы берут замороженный XLS-R и делают слой-wise decision fusion, но главный практический вывод связан с подготовкой данных. Удаление тишины ухудшает in-domain EER, зато резко улучшает перенос на внешний набор.

Метод. Вместо выбора одного слоя XLS-R авторы обучают небольшие классификаторы по слоям и объединяют решения. Проверяются несколько вариантов нормализации и усреднения, включая layer-wise fusion с batch normalization. Отдельно сравниваются режимы обучения с тишиной и без нее, что важно для fake audio detection: генераторы и датасеты могут оставлять разные следы в паузах, не связанные с голосом.

Результаты. Лучший вариант LW BN без тишины получает EER 5.27% на ASVspoof и 6.90% на In-The-Wild. Та же конфигурация с тишиной дает почти идеальный ASVspoof EER 0.33%, но проваливается на переносе: ITW EER 16.83%. Среди базовых систем NN-ASP без тишины дает ITW EER 9.49%, а NN-ACP - 10.27%, то есть layer-wise fusion действительно помогает внешнему набору.

Ограничения. Работа сфокусирована на двух корпусах и одном семействе самоконтролируемых признаков, поэтому нельзя считать результат универсальным для всех дипфейк-детекторов. Удаление тишины может быть вредным в сценариях, где паузы сами являются частью атаки или записи. Кроме того, EER не показывает стоимость ошибок при разных рабочих порогах, а для продукта важны FAR/FRR при заданной политике риска.

Фишка из статьи. Главная фишка - редкий, но полезный negative result: тишина дает красивый in-domain скор, но ухудшает перенос. Это хорошо видно, если смотреть не на одну строку лидерборда, а на пару ASVspoof/ITW.

МетодТишинаASVspoof EERITW EER
XLS-R 300M + LW BNесть0.33%16.83%
XLS-R 300M + LW BNудалена5.27%6.90%
NN-ASPесть0.22%11.10%
NN-ASPудалена5.56%9.49%
NN-ACPесть0.19%11.09%
NN-ACPудалена8.09%10.27%

Как это читать: низкий ASVspoof EER с тишиной может означать, что модель выучила артефакты корпуса, а не устойчивые признаки синтетической речи. Для промышленной проверки лучше сразу держать внешний набор, иначе метрика будет слишком оптимистичной.

Оригинальная статья на arXiv