Детекция дипфейков Синтез речи Voice conversion
Голосовые дипфейки

VoxENES 2026: новые генераторы ломают детекторы голосовых дипфейков

EER 28.98%

VoxENES 2026 - это не очередной набор красивых примеров синтеза речи, а стресс-тест для детекторов подделанной речи на современных системах синтеза и преобразования голоса. Статья интересна тем, что сдвигает фокус с «умеет ли детектор ловить старые атаки» на обобщение к LLM-era генераторам, сжатиям, шумам и изменению скорости. Вывод жесткий: даже лучший из проверенных детекторов имеет EER 28.98%, а несколько популярных архитектур работают почти как случайное решение.

Метод. Авторы собирают 53 628 фрагментов: 3028 реальных записей из LibriSpeech и VoxPopuli, 4600 исходных синтетических и 46 000 аугментированных синтетических. Подделки сделаны семью системами синтеза речи и тремя системами преобразования голоса, включая VoxCPM1.5, Qwen3-TTS, GLM-TTS, CosyVoice3, Seed-VC, OpenVoice v2 и RVC v2. Все аудио приведено к 16 kHz mono WAV и ограничено 4 секундами. Затем проверяются восемь детекторов: AASIST2, RawNet2, Wav2Vec2-AASIST, Wav2Vec2-DF, Wav2Vec2-Large, AST-ASVspoof5, Wav2Vec2-ASVspoof5 и ECAPA-TDNN.

Результаты. Лучший общий результат дает AST-ASVspoof5: EER 28.98% и accuracy 75.94%. Это все еще высокий уровень ошибок для задачи безопасности. Wav2Vec2-AASIST получает EER 39.16%, ECAPA-TDNN - 43.22%, RawNet2 - 47.03%, а AASIST2 - 57.86%. Разделение по типам атак важно: AST лучше держится на синтезе речи с EER 20.9%, но на преобразовании голоса поднимается до 29.8%; Seed-VC особенно труден, и ни один детектор не опускается ниже 41% EER.

Ограничения. Это прежде всего benchmark-работа: авторы не обучают новый детектор и не дают готового рецепта устойчивости. Набор охватывает только английский и испанский, длина ограничена 4 секундами, а сравниваемые детекторы обучались на разных исходных корпусах. Поэтому числа нельзя читать как окончательный рейтинг архитектур, но как проверку обобщения на свежие генераторы работа полезна.

Фишка из статьи. Особенно показательно, что постобработка не просто «портит» или «улучшает» задачу одинаково для всех. MP3 64 kbps резко ухудшает лучший AST-детектор, а белый шум 10 dB для одних моделей облегчает распознавание подделок, для других - ломает.

ДетекторОбщий EEREER на синтезе речиEER на преобразовании голоса
AST-ASVspoof528.98%20.9%29.8%
Wav2Vec2-AASIST39.16%43.7%38.4%
ECAPA-TDNN43.22%28.5%52.5%
AASIST257.86%61.2%49.9%

Как это читать: одна и та же архитектура может выглядеть приемлемо на синтезе речи и проваливаться на преобразовании голоса. Для практического детектора подделанной речи средний EER мало что говорит без разреза по генератору, постобработке и типу атаки.

Оригинальная статья на arXiv