Anti-spoofing MoE SSL
Deepfake detection

MoE-конверсия SSL-моделей для anti-spoofing улучшает EER на 14 датасетах

EER -11.9%

Работа от Université d'Avignon + Airbus Defence & Space (Daumain, Matrouf, Khelif, Rouvier), 12 июня 2026. Прямо релевантна тем, кто работает с audio deepfake detection: подход атакует ключевую проблему — генерализацию на невидимые методы синтеза.

Недавние успехи в speech generation существенно улучшили натуральность синтетической речи, что делает детекцию спуфинга всё более сложной. Ключевое ограничение современных anti-spoofing систем — ограниченная робастность к невидимым методам синтеза. Авторы трансформируют self-supervised speech representation модель в Mixture-of-Experts архитектуру для улучшения генерализации. Feed-forward блоки в выбранных слоях энкодера заменяются на множество экспертных сетей, контролируемых layer-wise gating механизмом, что позволяет экспертам захватывать комплементарные акустические паттерны при сохранении репрезентаций, обученных во время self-supervised pretraining.

Подход оценён на 14 спуфинг-датасетах и снижает macro EER с 5.46% до 4.81%, что соответствует 11.9% относительному улучшению относительно бейзлайна.

Чтобы понять важность, надо обозначить открытую проблему anti-spoofing 2023-2026. Все классические подходы (RawNet2, AASIST, wav2vec2-AASIST, гибриды на CatBoost) показывают отличные in-distribution результаты — на тестовых сетах ASVspoof2019/2021 EER падает до 0.5-1%. Но в реальном проде, где злоумышленники используют ElevenLabs, F5-TTS, CosyVoice, dots.tts — методы, которых не было в трейне, — EER подскакивает до 15-30%. Это «cross-domain generalization gap», и он не решается просто добавлением новых синтетических данных в трейн.

Идея MoE здесь работает иначе, чем в LLM. В LLM эксперты специализируются на доменах (код, естественный язык, математика) и выбираются по семантике входа. Здесь эксперты должны специализироваться на типах артефактов синтеза — кто-то ловит codec-artifacts (EnCodec, DAC), кто-то — vocoder-artifacts (HiFiGAN, BigVGAN), кто-то — flow-matching artifacts (F5, dots), кто-то — diffusion-artifacts. Layer-wise gating решает, какой эксперт активировать на каком слое для каждого фрейма. На fake-аудио, у которого артефакты от нескольких источников одновременно (например, F5-TTS → vocoder → telephony codec), активируется комбинация экспертов.

Сохранение SSL-репрезентаций — критический момент. Базовая wav2vec 2.0 или WavLM обучалась на 60K часов чистой речи и содержит мощные представления того, как «должна» звучать настоящая речь. Если переучивать всё с нуля под anti-spoofing, эти знания теряются, модель overfits на специфику тренировочного спуфинг-датасета. MoE-конверсия меняет только FFN-блоки выбранных слоёв, сохраняя attention-слои и общие репрезентации.

Замечу архитектурное родство с другой работой того же месяца — Multilingual LLM-based ASR с MoE (arXiv:2606.10439). MoE становится трендом 2026 года не только для масштабирования LLM, но и как инструмент структурированной специализации в speech-задачах. Логика одна: задача внутренне многоликая (разные языки в ASR, разные источники артефактов в anti-spoofing), и архитектура должна позволить специализироваться без потери общей робастности.

Для тех, кто уже работает с antispoofing-стеком из Zipformer + RawNet3 + CatBoost — этот подход показывает альтернативный путь: пост-хок MoE-конверсия существующего SSL-бэкбона. Изящнее, чем растить ансамбль из разных моделей и агрегировать их.

Фишка из статьи. В MoE-адаптации SSL-моделей для anti-spoofing лучший эффект дает поздняя вставка экспертов, а не полная замена всех слоев. Еще интереснее, что routing не демонстрирует простой специализации по synthesizer/source: эксперты используются достаточно сбалансированно, а JS divergence между распределениями невысокая.

Где вставлен MoE в WavLM-LMacro EERMicro EER
Baseline, 13 layers5.462314.9492
First 6 layers5.601615.3498
Last 6 layers5.212813.8028
All 13 layers5.765614.1291
Alternating layers5.420714.2723
Pooling для last-6 MoEMacro EERMicro EER
Attentive4.990213.3886
Statistical4.813012.3375
Max4.905512.7318
Mean5.349013.7534

Итоговая конфигурация - последние шесть слоев WavLM-L, E=4, top-k=1 и statistical pooling - дает macro EER 4.81%, то есть около 11.9% относительного улучшения против baseline 5.46%. Набор из 14 spoofing datasets делает этот вывод более надежным, чем single-benchmark сравнение.

Оригинальная статья на arXiv