Дипфейки Эмоции Robustness
arXiv eess.AS

AffectDF: эмоциональные атаки на детекторы речевых дипфейков

arXiv:2608.05507

AffectDF показывает неприятный разрыв между лабораторным обнаружением синтетической речи и эмоционально выразительными атаками. Авторы собирают крупный контрольный набор, где подделки создаются не только обычным синтезом и преобразованием голоса, но и эмоционально управляемыми системами. Ценность работы в том, что она проверяет детекторы в условиях, где эмоция становится не побочным стилем, а частью атаки.

Метод. Набор включает около 260 часов речи, 21 тип атаки, пять эмоциональных состояний и разделение на обучение, валидацию и тест. В него входят обычные TTS/voice conversion, эмоциональное преобразование голоса, а также атаки на основе аудио-языковых моделей. Авторы сравнивают классические детекторы речевых дипфейков, самоконтролируемые признаки и большие аудио-языковые модели, причем отдельно смотрят перенос между ASVspoof, EmoFake и AffectDF.

Результаты. Самый важный результат - провал переноса. RawNet2, обученный на ASVspoof2019, имеет EER 4.60% на ASVspoof2019, но 59.71% на AffectDF; AASIST в аналогичном переносе получает 56.40% EER на AffectDF. Даже обучение на AffectDF не делает задачу простой: RawNet2 снижается до 23.17% EER на AffectDF, но одновременно ухудшается на ASVspoof2019 до 43.02%. Размер набора тоже существенный: 86 999 обучающих, 23 330 валидационных и 175 468 тестовых примеров.

Ограничения. Набор смешивает разные факторы: тип атаки, эмоцию, источник речи и различие между актерской и спонтанной выразительностью. Поэтому отдельные причины ошибок не всегда можно полностью развести. Кроме того, тонкая настройка больших аудио-языковых моделей проверяется ограниченно, а практические сценарии с телефонным каналом, сжатием и шумом требуют отдельной проверки.

Фишка из статьи. Особенно показателен разрыв между «старым» тестом и AffectDF. Детектор может выглядеть сильным на ASVspoof2019, но почти терять смысл при эмоциональных атаках: EER около 50% означает почти случайное решение.

Детектор и обучениеASVspoof2019 EERAffectDF EERЧто происходит
RawNet2, обучение ASVspoof20194.60%59.71%резкий провал на эмоциональных атаках
AASIST, обучение ASVspoof2019низкая ошибка на исходном домене56.40%перенос почти не работает
RawNet2, обучение AffectDF43.02%23.17%адаптация помогает AffectDF, но ломает старый домен

Как это читать: EER около 50-60% означает, что модель не отличает подделку от настоящей речи лучше надежной системы. Главный вывод не «нужен еще один датасет», а то, что эмоциональная выразительность меняет распределение артефактов и разрушает привычный перенос детекторов.

Оригинальная статья на arXiv