Объяснимая детекция поддельной речи через экспертов артефактов
Эта статья полезна не как новый лидерборд по детекции поддельной речи, а как попытка сделать решение интерпретируемым. Вместо одного черного ящика авторы заводят отдельных экспертов по типам артефактов синтеза: F0, oversmoothing, фазовые ошибки, провалы энергии и тональные пики. Каждый эксперт выдает калиброванное логарифмическое отношение правдоподобий, которое можно суммировать и читать как вклад конкретного артефакта.
Метод. Эксперты обучаются не на настоящих TTS-атаках, а на pseudo-fake данных: реальная речь копируется и модифицируется так, чтобы в ней был ровно нужный артефакт. Затем сырые оценки калибруются в LLR через CMLG или KDE, а на уровне ансамбля сравниваются сумма LLR, максимум и gating network. Такая схема отделяет обнаружение признака от принятия конечного решения и позволяет добавлять новых экспертов без переобучения остальных.
Результаты. На целевых атаках ASVspoof 2019 эксперты по oversmoothing и degraded phase работают лучше всего: AUC 97.64/EER 6.62% и AUC 98.50/EER 6.24% соответственно. Эксперт по F0 слабее - AUC 77.64 и EER 29.38%, что авторы связывают с менее устойчивым проявлением такого артефакта. Для ансамбля лучшей оказалась простая сумма экспертных LLR: EER 19.76% и Cllr 0.638 против 22.22%/0.855 у max-агрегации и 21.54%/0.907 у gating network.
Ограничения. Это exploratory study, и авторы прямо ограничиваются заранее известными артефактами. Если новый генератор не проявляет эти признаки или имитирует естественную фазу и динамику, схема может дать слабый сигнал. Абсолютный EER ансамбля далек от лучших закрытых детекторов, зато работа выигрывает в диагностике и проверке shortcut-ов.
Фишка из статьи. Наиболее практичный результат - калибровка важнее размера calibration-набора. Лучший ансамбль получается не от learned gating, а от простой суммы LLR после общей калибровки на pooled ASVspoof 2019.
| Агрегация экспертов | EER | Cllr | Что означает |
|---|---|---|---|
| Sum of Expert LLRs | 19.76% | 0.638 | лучший баланс детекции и калибровки |
| Maximum Expert LLR | 22.22% | 0.855 | ставка на один сильный артефакт хуже |
| Gating Network | 21.54% | 0.907 | обучаемое смешивание не помогло |
Как это читать: если LLR хорошо откалиброваны, их сложение оказывается сильнее и понятнее, чем нейросетевой gate. Это важный инженерный вывод для forensic-сценариев, где объяснение решения почти так же важно, как EER.