Dataset-aware deepfake detection: когда dataset_id полезнее language labels
Статья про детекцию поддельной речи берет неприятную, но реальную проблему: модели часто учатся не "подделке", а следам конкретного набора данных, кодека или процедуры записи. Авторы проверяют, можно ли использовать идентификатор датасета как явный учебный сигнал, а не притворяться, что этого фактора нет. Они сравнивают два варианта: многозадачное обучение с dataset-aware labels и Gradient Reversal Loss для выталкивания датасетной информации из признаков.
Метод. Базовый детектор имеет 315.4M параметров и обучается на смеси ASVspoof, Fake or Real, DFADD, MLAAD, Codecfake и других корпусов, всего 7 325.65 часа. В многозадачном варианте вспомогательная метка объединяет тип датасета и класс bona fide/spoof. В GRL-варианте модель наоборот получает штраф за возможность восстановить датасет из признаков, чтобы сделать представление более инвариантным.
Результаты. На Speech DeepFake Arena baseline дает средний EER 9.484 и pooled EER 12.596. Многозадачный вариант снижает средний EER до 8.238, то есть примерно на 13.14% относительно baseline, но ухудшает pooled EER до 13.050. GRL почти не меняет средний EER - 9.379, зато улучшает pooled EER до 11.926. Это важное разделение: один режим лучше для средней устойчивости по наборам, другой - для объединенной выборки.
Ограничения. Dataset ID может кодировать не только домен, но и случайные артефакты сбора, поэтому есть риск переобучения на метаданные. Авторы не объединяют MT и GRL в одну систему и используют один backbone; в реальной эксплуатации распределение подделок и кодеков может отличаться сильнее, чем в бенчмарке.
Фишка из статьи. Самый показательный результат - сравнение вспомогательных меток. Языковые метки для GRL оказываются заметно хуже, чем датасетные: для поддельной речи домен записи и генерации может быть важнее языка.
| Режим | Вспомогательная метка | Средний EER | Pooled EER |
|---|---|---|---|
| MT | dataset only | 10.139 | 14.762 |
| MT | dataset type x spoof | 8.238 | 13.050 |
| GRL | language labels | 11.192 | 12.939 |
| GRL | dataset labels | 9.379 | 11.926 |
Как это читать: "нейтрализовать язык" не равно "нейтрализовать домен". Для детекции deepfake лучше явно учитывать, из какого набора и протокола пришел звук, иначе модель может спутать следы корпуса с признаками синтеза.