ParlaSpoof-BR: политическая речь и смещение детекторов deepfake
ParlaSpoof-BR полезна тем, что переносит детекцию поддельной речи из лабораторного англоязычного режима в политически чувствительный бразильский контекст. Авторы собирают парламентскую речь, клонируют голоса разными системами синтеза и преобразования голоса, а затем проверяют, где современные детекторы ошибаются. Главный результат неприятный: лучший из проверенных детекторов дал EER 32.30%, а старые антиспуфинговые модели фактически провалились.
Метод. Набор строится из записей Палаты депутатов Бразилии: 40 спикеров, поровну мужчин и женщин, с балансом по пяти регионам. Для каждого взято по 50 высказываний, всего 2,000 настоящих фрагментов; отдельные 10-секундные отрезки использованы как референсы для клонирования. Атаки включают пять систем синтеза речи, пять систем преобразования голоса, частичную замену фрагментов через OmniVoice, шум babble на разных SNR и варианты с MP3/OGG-перекодированием. В сумме корпус содержит 134,400 файлов.
Результаты. На ParlaSpoof-BR AASIST показывает EER 50.98% и AUC 0.481, AASIST-L еще хуже по EER 53.70% и AUC 0.445. DF-Arena-1B заметно лучше, но тоже дал EER 32.30% и AUC 0.715; это означает, что пороговое разделение настоящей и поддельной речи остается слабым. По типам атак DF-Arena легче ловит преобразование голоса: средний EER 26.8% и recall 94.9%. Синтез речи сложнее: средний EER 39.3%, а для Qwen3-TTS recall всего 31.2%, для VoxCPM2 41.4%.
Ограничения. Корпус силен как политический и португалоязычный стресс-тест, но это все равно синтетически созданный набор атак, а не реальные кампании дезинформации. Проверены только три детектора, поэтому нельзя делать вывод обо всем классе моделей. Качество синтетики оценивается автоматическими метриками, без большой субъективной панели. Демографические разрывы по региону и полу в этой работе меньше, чем разрывы по генератору, но датасет из 40 голосов все же не закрывает вопрос справедливости.
Фишка из статьи. Наиболее тревожный результат не в полном клонировании, а в частичной подмене речи. Если изменить только четверть записи, лучший детектор DF-Arena часто пропускает атаку, хотя такие вставки могут быть политически разрушительными: достаточно заменить обещание, отрицание или имя.
| Атака | Доля измененной речи | Recall DF-Arena | Почему важно |
|---|---|---|---|
| Contiguous infilling | 25% | 29.2% | Локальная фальсификация почти так же трудна, как сильные TTS-атаки |
| Contiguous infilling | 50% | 45.2% | Даже половинная подмена часто не ловится |
| Contiguous infilling | 75% | 73.5% | Детектор становится увереннее только при большой доле синтетики |
| LLM-guided infilling | частичная | 29.5% | Семантически выбранная вставка остается сложной |
Как это читать: частичная атака с 25% измененной речи имеет recall 29.2%, что сопоставимо с полным синтезом Qwen3-TTS, где recall 31.2%. Это меняет модель угрозы: детектор, обученный искать "синтетический голос целиком", может не заметить короткую, но смысловую подмену.