Уязвимость детекторов аудиодипфейков к нейросетевым кодекам и её снижение
Современные детекторы поддельного аудио часто считают артефакты нейросетевого кодека признаком синтеза. Поэтому законно сжатая настоящая речь начинает выглядеть поддельной. Авторы выделяют эту ошибку отдельно и обучают представление быть согласованным для исходной и перекодированной версии одной фразы.
Метод. ANC-Spoof содержит 158 713 исходных и 1 110 991 перекодированную запись: семь нейрокодеков применяются к реальным и поддельным данным ASVspoof 2019 LA, In-the-Wild и FoR. PCL-NET дообучает XLS-R 300M с попарной функцией, сближающей признаки исходной и сжатой речи, при сохранении классификации real/fake.
Результаты. У XLS-R-2B на FoR EER равен 1,01% без кодека, но в среднем 51,2% после нейросетевого сжатия. PCL-NET, обученный на смеси семи кодеков, снижает средний EER по кодекам до 5,15% на ASV19, 23,44% на Wild и 9,82% на FoR; у базовой модели это 6,92%, 23,53% и 41,93%. При этом на CoSG-дипфейках остаётся разрыв до специализированных детекторов.
Ограничения. Разметка перекодированной подделки не меняется, хотя некоторые кодеки могут стирать следы исходного генератора. Набор синтетически построен поверх трёх бенчмарков и семи кодеков; неизвестные кодеки и реальные платформенные цепочки не проверены. Данные обещаны только после принятия статьи.
Фишка из статьи. Специализированное обучение на codec-resynthesis может ухудшить именно законное сжатие сильнее, чем обычная модель. Детектор XLS-R-2B почти идеален на исходном FoR, но становится случайным после нейрокодека.
| Детектор на FoR | EER без кодека, % | Средний EER по 7 нейрокодекам, % |
|---|---|---|
| XLS-R-SLS | 10,16 | 38,57 |
| W2W2-AASIST, обучение на codec-resynthesis | 0,67 | 34,31 |
| XLS-R-2B, обучение на codec-resynthesis | 1,01 | 51,20 |
| PCL-NET, смесь кодеков | 2,24 | 9,82 |
Как это читать: низкая ошибка на исходных данных не предсказывает устойчивость. Если модель выучила «кодек равно подделка», повышение точности на одном типе синтеза превращается в ложные тревоги на обычной передаче речи.