MoE-конверсия SSL-моделей для anti-spoofing улучшает EER на 14 датасетах
Работа от Université d'Avignon + Airbus Defence & Space (Daumain, Matrouf, Khelif, Rouvier), 12 июня 2026. Прямо релевантна тем, кто работает с audio deepfake detection: подход атакует ключевую проблему — генерализацию на невидимые методы синтеза.
Недавние успехи в speech generation существенно улучшили натуральность синтетической речи, что делает детекцию спуфинга всё более сложной. Ключевое ограничение современных anti-spoofing систем — ограниченная робастность к невидимым методам синтеза. Авторы трансформируют self-supervised speech representation модель в Mixture-of-Experts архитектуру для улучшения генерализации. Feed-forward блоки в выбранных слоях энкодера заменяются на множество экспертных сетей, контролируемых layer-wise gating механизмом, что позволяет экспертам захватывать комплементарные акустические паттерны при сохранении репрезентаций, обученных во время self-supervised pretraining.
Подход оценён на 14 спуфинг-датасетах и снижает macro EER с 5.46% до 4.81%, что соответствует 11.9% относительному улучшению относительно бейзлайна.
Чтобы понять важность, надо обозначить открытую проблему anti-spoofing 2023-2026. Все классические подходы (RawNet2, AASIST, wav2vec2-AASIST, гибриды на CatBoost) показывают отличные in-distribution результаты — на тестовых сетах ASVspoof2019/2021 EER падает до 0.5-1%. Но в реальном проде, где злоумышленники используют ElevenLabs, F5-TTS, CosyVoice, dots.tts — методы, которых не было в трейне, — EER подскакивает до 15-30%. Это «cross-domain generalization gap», и он не решается просто добавлением новых синтетических данных в трейн.
Идея MoE здесь работает иначе, чем в LLM. В LLM эксперты специализируются на доменах (код, естественный язык, математика) и выбираются по семантике входа. Здесь эксперты должны специализироваться на типах артефактов синтеза — кто-то ловит codec-artifacts (EnCodec, DAC), кто-то — vocoder-artifacts (HiFiGAN, BigVGAN), кто-то — flow-matching artifacts (F5, dots), кто-то — diffusion-artifacts. Layer-wise gating решает, какой эксперт активировать на каком слое для каждого фрейма. На fake-аудио, у которого артефакты от нескольких источников одновременно (например, F5-TTS → vocoder → telephony codec), активируется комбинация экспертов.
Сохранение SSL-репрезентаций — критический момент. Базовая wav2vec 2.0 или WavLM обучалась на 60K часов чистой речи и содержит мощные представления того, как «должна» звучать настоящая речь. Если переучивать всё с нуля под anti-spoofing, эти знания теряются, модель overfits на специфику тренировочного спуфинг-датасета. MoE-конверсия меняет только FFN-блоки выбранных слоёв, сохраняя attention-слои и общие репрезентации.
Замечу архитектурное родство с другой работой того же месяца — Multilingual LLM-based ASR с MoE (arXiv:2606.10439). MoE становится трендом 2026 года не только для масштабирования LLM, но и как инструмент структурированной специализации в speech-задачах. Логика одна: задача внутренне многоликая (разные языки в ASR, разные источники артефактов в anti-spoofing), и архитектура должна позволить специализироваться без потери общей робастности.
Для тех, кто уже работает с antispoofing-стеком из Zipformer + RawNet3 + CatBoost — этот подход показывает альтернативный путь: пост-хок MoE-конверсия существующего SSL-бэкбона. Изящнее, чем растить ансамбль из разных моделей и агрегировать их.
Фишка из статьи. В MoE-адаптации SSL-моделей для anti-spoofing лучший эффект дает поздняя вставка экспертов, а не полная замена всех слоев. Еще интереснее, что routing не демонстрирует простой специализации по synthesizer/source: эксперты используются достаточно сбалансированно, а JS divergence между распределениями невысокая.
| Где вставлен MoE в WavLM-L | Macro EER | Micro EER |
|---|---|---|
| Baseline, 13 layers | 5.4623 | 14.9492 |
| First 6 layers | 5.6016 | 15.3498 |
| Last 6 layers | 5.2128 | 13.8028 |
| All 13 layers | 5.7656 | 14.1291 |
| Alternating layers | 5.4207 | 14.2723 |
| Pooling для last-6 MoE | Macro EER | Micro EER |
|---|---|---|
| Attentive | 4.9902 | 13.3886 |
| Statistical | 4.8130 | 12.3375 |
| Max | 4.9055 | 12.7318 |
| Mean | 5.3490 | 13.7534 |
Итоговая конфигурация - последние шесть слоев WavLM-L, E=4, top-k=1 и statistical pooling - дает macro EER 4.81%, то есть около 11.9% относительного улучшения против baseline 5.46%. Набор из 14 spoofing datasets делает этот вывод более надежным, чем single-benchmark сравнение.