Deepfake GRL Multitask
Детекция поддельной речи

Dataset-aware deepfake detection: когда dataset_id полезнее language labels

EER 8.238%

Статья про детекцию поддельной речи берет неприятную, но реальную проблему: модели часто учатся не "подделке", а следам конкретного набора данных, кодека или процедуры записи. Авторы проверяют, можно ли использовать идентификатор датасета как явный учебный сигнал, а не притворяться, что этого фактора нет. Они сравнивают два варианта: многозадачное обучение с dataset-aware labels и Gradient Reversal Loss для выталкивания датасетной информации из признаков.

Метод. Базовый детектор имеет 315.4M параметров и обучается на смеси ASVspoof, Fake or Real, DFADD, MLAAD, Codecfake и других корпусов, всего 7 325.65 часа. В многозадачном варианте вспомогательная метка объединяет тип датасета и класс bona fide/spoof. В GRL-варианте модель наоборот получает штраф за возможность восстановить датасет из признаков, чтобы сделать представление более инвариантным.

Результаты. На Speech DeepFake Arena baseline дает средний EER 9.484 и pooled EER 12.596. Многозадачный вариант снижает средний EER до 8.238, то есть примерно на 13.14% относительно baseline, но ухудшает pooled EER до 13.050. GRL почти не меняет средний EER - 9.379, зато улучшает pooled EER до 11.926. Это важное разделение: один режим лучше для средней устойчивости по наборам, другой - для объединенной выборки.

Ограничения. Dataset ID может кодировать не только домен, но и случайные артефакты сбора, поэтому есть риск переобучения на метаданные. Авторы не объединяют MT и GRL в одну систему и используют один backbone; в реальной эксплуатации распределение подделок и кодеков может отличаться сильнее, чем в бенчмарке.

Фишка из статьи. Самый показательный результат - сравнение вспомогательных меток. Языковые метки для GRL оказываются заметно хуже, чем датасетные: для поддельной речи домен записи и генерации может быть важнее языка.

РежимВспомогательная меткаСредний EERPooled EER
MTdataset only10.13914.762
MTdataset type x spoof8.23813.050
GRLlanguage labels11.19212.939
GRLdataset labels9.37911.926

Как это читать: "нейтрализовать язык" не равно "нейтрализовать домен". Для детекции deepfake лучше явно учитывать, из какого набора и протокола пришел звук, иначе модель может спутать следы корпуса с признаками синтеза.

Оригинальная статья на arXiv