Поддельная речь Артефакты Калибровка
Детекция дипфейков

Объяснимая детекция поддельной речи через экспертов артефактов

EER 19.76%

Эта статья полезна не как новый лидерборд по детекции поддельной речи, а как попытка сделать решение интерпретируемым. Вместо одного черного ящика авторы заводят отдельных экспертов по типам артефактов синтеза: F0, oversmoothing, фазовые ошибки, провалы энергии и тональные пики. Каждый эксперт выдает калиброванное логарифмическое отношение правдоподобий, которое можно суммировать и читать как вклад конкретного артефакта.

Метод. Эксперты обучаются не на настоящих TTS-атаках, а на pseudo-fake данных: реальная речь копируется и модифицируется так, чтобы в ней был ровно нужный артефакт. Затем сырые оценки калибруются в LLR через CMLG или KDE, а на уровне ансамбля сравниваются сумма LLR, максимум и gating network. Такая схема отделяет обнаружение признака от принятия конечного решения и позволяет добавлять новых экспертов без переобучения остальных.

Результаты. На целевых атаках ASVspoof 2019 эксперты по oversmoothing и degraded phase работают лучше всего: AUC 97.64/EER 6.62% и AUC 98.50/EER 6.24% соответственно. Эксперт по F0 слабее - AUC 77.64 и EER 29.38%, что авторы связывают с менее устойчивым проявлением такого артефакта. Для ансамбля лучшей оказалась простая сумма экспертных LLR: EER 19.76% и Cllr 0.638 против 22.22%/0.855 у max-агрегации и 21.54%/0.907 у gating network.

Ограничения. Это exploratory study, и авторы прямо ограничиваются заранее известными артефактами. Если новый генератор не проявляет эти признаки или имитирует естественную фазу и динамику, схема может дать слабый сигнал. Абсолютный EER ансамбля далек от лучших закрытых детекторов, зато работа выигрывает в диагностике и проверке shortcut-ов.

Фишка из статьи. Наиболее практичный результат - калибровка важнее размера calibration-набора. Лучший ансамбль получается не от learned gating, а от простой суммы LLR после общей калибровки на pooled ASVspoof 2019.

Агрегация экспертовEERCllrЧто означает
Sum of Expert LLRs19.76%0.638лучший баланс детекции и калибровки
Maximum Expert LLR22.22%0.855ставка на один сильный артефакт хуже
Gating Network21.54%0.907обучаемое смешивание не помогло

Как это читать: если LLR хорошо откалиброваны, их сложение оказывается сильнее и понятнее, чем нейросетевой gate. Это важный инженерный вывод для forensic-сценариев, где объяснение решения почти так же важно, как EER.

Оригинальная статья на arXiv