Deepfake SSL EER
Детекция поддельной речи

REIMU: рекуррентность не всегда улучшает детекцию поддельной речи

EER 1.36%

REIMU полезна как трезвая проверка идеи "добавим reasoning depth к SSL-признакам и детекция deepfake станет лучше". Авторы сравнивают обычные single-pass backbones, weight-shared recurrence, homogeneous HRM и heterogeneous HRM на четырех SSL frontends. Главный вывод осторожный: рекуррентность и иерархия сами по себе не гарантируют выигрыш; помогает именно неоднородное назначение операторов и частичное дообучение верхних SSL-слоев.

Метод. Все системы используют frame-level признаки замороженного или частично дообученного SSL encoder: wav2vec 2.0 Base, HuBERT Base, WavLM Base и WavLM Base+. Downstream backbone скрытой размерности 128 сравнивается с операторами MHSA, GDN2 и Raven. Heterogeneous HRM ставит MHSA на high-level обновления, а GDN2 или Raven - на low-level обновления, чтобы разные частоты обновления не дублировали один и тот же оператор. Агрегация делается через Multi-Head Gated Attention Pooling.

Результаты. В frozen-frontends режиме single-pass baseline уже силен: wav2vec2 Base + Raven дает EER 4.33% на ASVspoof 2019 LA, 9.77% на 2021 LA и 17.72% на 2021 DF. Простая weight-shared recurrence непостоянна: HuBERT + MHSA с 3 проходами снижает 21DF EER с 19.06% до 15.97%, но Raven часто деградирует. После selective SSL fine-tuning heterogeneous H2L2 достигает EER 1.36%, 6.72%, 11.64% без data augmentation, а с augmentation получает 4.52%, 4.93%, 10.69%. Hetero-HRM использует 1.252M downstream parameters против 1.405M у GDN2 baseline, на 10.89% меньше.

Ограничения. Все модели обучаются на ASVspoof 2019 LA, поэтому проверка доменного переноса ограничена протоколами ASVspoof 2021 LA/DF. Архитектурный выигрыш зависит от выбранного SSL frontend и оператора; универсального победителя нет. Data augmentation улучшает cross-domain EER, но ухудшает in-domain 19LA. Метрика EER не показывает поведение на реальных политических, телефонных или социальных deepfake-сценариях.

Фишка из статьи. Самое ценное - отрицательный результат: повторение одного и того же блока может ухудшать detection. В финальной абляции видно, что Looped recurrence уступает и baseline, и heterogeneous HRM, особенно без augmentation.

Архитектура, selective SSL fine-tuning19LA EER21LA EER21DF EERРежим
Baseline 6-layer1.507.2612.07без augmentation
Looped, 2 passes6.0910.3921.42без augmentation
Hetero-HRM H2L21.366.7211.64без augmentation
Baseline 6-layer4.475.149.54с augmentation
Hetero-HRM H2L24.524.9310.69с augmentation

Как это читать: Hetero-HRM дает лучший 19LA и 21LA без augmentation, но baseline с augmentation лучше на 21DF. Поэтому результат стоит читать не как победу новой архитектуры везде, а как демонстрацию того, что неоднородные операторы могут быть параметрически эффективным вариантом, когда фронтенд адаптируется.

Оригинальная статья на arXiv