Детекция fake audio: тишина помогает in-domain и вредит переносу
Эта статья ценна тем, что показывает неочевидную ловушку детекции поддельного аудио: отличный результат на ASVspoof может плохо переноситься на реальные записи in-the-wild. Авторы берут замороженный XLS-R и делают слой-wise decision fusion, но главный практический вывод связан с подготовкой данных. Удаление тишины ухудшает in-domain EER, зато резко улучшает перенос на внешний набор.
Метод. Вместо выбора одного слоя XLS-R авторы обучают небольшие классификаторы по слоям и объединяют решения. Проверяются несколько вариантов нормализации и усреднения, включая layer-wise fusion с batch normalization. Отдельно сравниваются режимы обучения с тишиной и без нее, что важно для fake audio detection: генераторы и датасеты могут оставлять разные следы в паузах, не связанные с голосом.
Результаты. Лучший вариант LW BN без тишины получает EER 5.27% на ASVspoof и 6.90% на In-The-Wild. Та же конфигурация с тишиной дает почти идеальный ASVspoof EER 0.33%, но проваливается на переносе: ITW EER 16.83%. Среди базовых систем NN-ASP без тишины дает ITW EER 9.49%, а NN-ACP - 10.27%, то есть layer-wise fusion действительно помогает внешнему набору.
Ограничения. Работа сфокусирована на двух корпусах и одном семействе самоконтролируемых признаков, поэтому нельзя считать результат универсальным для всех дипфейк-детекторов. Удаление тишины может быть вредным в сценариях, где паузы сами являются частью атаки или записи. Кроме того, EER не показывает стоимость ошибок при разных рабочих порогах, а для продукта важны FAR/FRR при заданной политике риска.
Фишка из статьи. Главная фишка - редкий, но полезный negative result: тишина дает красивый in-domain скор, но ухудшает перенос. Это хорошо видно, если смотреть не на одну строку лидерборда, а на пару ASVspoof/ITW.
| Метод | Тишина | ASVspoof EER | ITW EER |
|---|---|---|---|
| XLS-R 300M + LW BN | есть | 0.33% | 16.83% |
| XLS-R 300M + LW BN | удалена | 5.27% | 6.90% |
| NN-ASP | есть | 0.22% | 11.10% |
| NN-ASP | удалена | 5.56% | 9.49% |
| NN-ACP | есть | 0.19% | 11.09% |
| NN-ACP | удалена | 8.09% | 10.27% |
Как это читать: низкий ASVspoof EER с тишиной может означать, что модель выучила артефакты корпуса, а не устойчивые признаки синтетической речи. Для промышленной проверки лучше сразу держать внешний набор, иначе метрика будет слишком оптимистичной.