Trajectory Dynamics in Self-Supervised Learning Latent Space for Audio Deepfake Detection
Работа проверяет, теряется ли важный сигнал при усреднении речевых признаков по времени. Оказывается, на трудных незнакомых подделках статическое положение точки почти бесполезно, тогда как ошибка предсказания следующего кадра по траектории даёт заметно более устойчивый детектор, обученный только на настоящей речи.
Метод. Замороженный Wav2Vec2-Large-AntiDeepfake выдаёт 1024-мерные признаки с частотой 50 кадров в секунду. Двухслойная причинная LSTM размерности 512 обучается на 2580 настоящих записях ASVspoof 2019 предсказывать следующий кадр; среднеквадратичная ошибка служит показателем аномалии. Второй, необязательный этап замораживает LSTM и обучает трёхслойный классификатор на 2580 настоящих и 22 800 поддельных примерах. Для честного сравнения статический вариант использует тот же кодировщик, но лишь расстояние от усреднённого вектора записи до центра настоящей речи.
Результаты. На близких к обучению наборах надзорный второй этап лучше: EER равен 1,11% на ASVspoof 2019, 0,75% на ASVspoof 2021 и 2,43% на Codecfake. На MLAAD-EN статическое усреднение разваливается до 22,86%, тогда как одно-классовая LSTM получает 5,71%, а надзорный этап 10,02%. На полностью внешнем DE2024 соответствующие значения равны 52,52%, 30,35% и 35,41%. Это означает, что временная динамика особенно полезна там, где классы уже смешались в статическом пространстве, а обучение на старых типах атак начинает мешать.
Ограничения. Одно-классовым является только модуль траектории: сам AntiDeepfake ранее обучался на 56 тысячах часов настоящей и 18 тысячах часов синтетической речи. Более того, синтетические части ASVspoof, Codecfake и MLAAD входили в его подготовку; полностью внешними остаются лишь In-the-Wild и DE2024. Опыты ограничены английской речью и одной причинной LSTM, а DE2024 режется на 10-секундные отрезки. На простых наборах первый этап хуже статического способа, поэтому универсальной замены надзорному детектору пока нет.
Фишка из статьи. По мере усложнения набора меняется не только величина ошибки, но и победитель: надзорный классификатор хорош рядом с обучающими атаками, а модель нормальной речевой динамики выигрывает на незнакомых генераторах.
| Набор | Статический EER | LSTM только на настоящей речи | Надзорный этап |
|---|---|---|---|
| ASVspoof 2021 | 0,98% | 1,88% | 0,75% |
| In-the-Wild | 4,03% | 4,84% | 3,28% |
| MLAAD-EN | 22,86% | 5,71% | 10,02% |
| DE2024 | 52,52% | 30,35% | 35,41% |
Как это читать: меньший EER лучше. На DE2024 один-классовая динамика всё ещё далека от надёжного детектора, но её преимущество над статическим представлением достигает 22,17 пункта; надзор по старым атакам, напротив, ухудшает перенос на 5,06 пункта относительно первого этапа.