Deepfake Португальский Смещение
Детекция поддельной речи

ParlaSpoof-BR: политическая речь и смещение детекторов deepfake

EER 32.30%

ParlaSpoof-BR полезна тем, что переносит детекцию поддельной речи из лабораторного англоязычного режима в политически чувствительный бразильский контекст. Авторы собирают парламентскую речь, клонируют голоса разными системами синтеза и преобразования голоса, а затем проверяют, где современные детекторы ошибаются. Главный результат неприятный: лучший из проверенных детекторов дал EER 32.30%, а старые антиспуфинговые модели фактически провалились.

Метод. Набор строится из записей Палаты депутатов Бразилии: 40 спикеров, поровну мужчин и женщин, с балансом по пяти регионам. Для каждого взято по 50 высказываний, всего 2,000 настоящих фрагментов; отдельные 10-секундные отрезки использованы как референсы для клонирования. Атаки включают пять систем синтеза речи, пять систем преобразования голоса, частичную замену фрагментов через OmniVoice, шум babble на разных SNR и варианты с MP3/OGG-перекодированием. В сумме корпус содержит 134,400 файлов.

Результаты. На ParlaSpoof-BR AASIST показывает EER 50.98% и AUC 0.481, AASIST-L еще хуже по EER 53.70% и AUC 0.445. DF-Arena-1B заметно лучше, но тоже дал EER 32.30% и AUC 0.715; это означает, что пороговое разделение настоящей и поддельной речи остается слабым. По типам атак DF-Arena легче ловит преобразование голоса: средний EER 26.8% и recall 94.9%. Синтез речи сложнее: средний EER 39.3%, а для Qwen3-TTS recall всего 31.2%, для VoxCPM2 41.4%.

Ограничения. Корпус силен как политический и португалоязычный стресс-тест, но это все равно синтетически созданный набор атак, а не реальные кампании дезинформации. Проверены только три детектора, поэтому нельзя делать вывод обо всем классе моделей. Качество синтетики оценивается автоматическими метриками, без большой субъективной панели. Демографические разрывы по региону и полу в этой работе меньше, чем разрывы по генератору, но датасет из 40 голосов все же не закрывает вопрос справедливости.

Фишка из статьи. Наиболее тревожный результат не в полном клонировании, а в частичной подмене речи. Если изменить только четверть записи, лучший детектор DF-Arena часто пропускает атаку, хотя такие вставки могут быть политически разрушительными: достаточно заменить обещание, отрицание или имя.

АтакаДоля измененной речиRecall DF-ArenaПочему важно
Contiguous infilling25%29.2%Локальная фальсификация почти так же трудна, как сильные TTS-атаки
Contiguous infilling50%45.2%Даже половинная подмена часто не ловится
Contiguous infilling75%73.5%Детектор становится увереннее только при большой доле синтетики
LLM-guided infillingчастичная29.5%Семантически выбранная вставка остается сложной

Как это читать: частичная атака с 25% измененной речи имеет recall 29.2%, что сопоставимо с полным синтезом Qwen3-TTS, где recall 31.2%. Это меняет модель угрозы: детектор, обученный искать "синтетический голос целиком", может не заметить короткую, но смысловую подмену.

Оригинальная статья на arXiv