AffectDF: эмоциональные атаки на детекторы речевых дипфейков
AffectDF показывает неприятный разрыв между лабораторным обнаружением синтетической речи и эмоционально выразительными атаками. Авторы собирают крупный контрольный набор, где подделки создаются не только обычным синтезом и преобразованием голоса, но и эмоционально управляемыми системами. Ценность работы в том, что она проверяет детекторы в условиях, где эмоция становится не побочным стилем, а частью атаки.
Метод. Набор включает около 260 часов речи, 21 тип атаки, пять эмоциональных состояний и разделение на обучение, валидацию и тест. В него входят обычные TTS/voice conversion, эмоциональное преобразование голоса, а также атаки на основе аудио-языковых моделей. Авторы сравнивают классические детекторы речевых дипфейков, самоконтролируемые признаки и большие аудио-языковые модели, причем отдельно смотрят перенос между ASVspoof, EmoFake и AffectDF.
Результаты. Самый важный результат - провал переноса. RawNet2, обученный на ASVspoof2019, имеет EER 4.60% на ASVspoof2019, но 59.71% на AffectDF; AASIST в аналогичном переносе получает 56.40% EER на AffectDF. Даже обучение на AffectDF не делает задачу простой: RawNet2 снижается до 23.17% EER на AffectDF, но одновременно ухудшается на ASVspoof2019 до 43.02%. Размер набора тоже существенный: 86 999 обучающих, 23 330 валидационных и 175 468 тестовых примеров.
Ограничения. Набор смешивает разные факторы: тип атаки, эмоцию, источник речи и различие между актерской и спонтанной выразительностью. Поэтому отдельные причины ошибок не всегда можно полностью развести. Кроме того, тонкая настройка больших аудио-языковых моделей проверяется ограниченно, а практические сценарии с телефонным каналом, сжатием и шумом требуют отдельной проверки.
Фишка из статьи. Особенно показателен разрыв между «старым» тестом и AffectDF. Детектор может выглядеть сильным на ASVspoof2019, но почти терять смысл при эмоциональных атаках: EER около 50% означает почти случайное решение.
| Детектор и обучение | ASVspoof2019 EER | AffectDF EER | Что происходит |
|---|---|---|---|
| RawNet2, обучение ASVspoof2019 | 4.60% | 59.71% | резкий провал на эмоциональных атаках |
| AASIST, обучение ASVspoof2019 | низкая ошибка на исходном домене | 56.40% | перенос почти не работает |
| RawNet2, обучение AffectDF | 43.02% | 23.17% | адаптация помогает AffectDF, но ломает старый домен |
Как это читать: EER около 50-60% означает, что модель не отличает подделку от настоящей речи лучше надежной системы. Главный вывод не «нужен еще один датасет», а то, что эмоциональная выразительность меняет распределение артефактов и разрушает привычный перенос детекторов.