Фонемные объяснения для детекторов голосовых дипфейков
Статья не пытается просто улучшить точность детектора голосовых дипфейков, а спрашивает, на какие фонетические участки он реально опирается. Авторы совмещают WavLM-based detector, сверточный классификатор, Grad-CAM и принудительное фонемное выравнивание, чтобы перевести saliency maps в фонемы, паузы и позиции внутри фонем. Это полезно для доверия к детекторам: можно увидеть не только «spoof или bona fide», но и какие звуковые единицы создают решение.
Метод. Детектор обучается на ASVspoof 5, затем для evaluation set извлекаются class-specific Grad-CAM карты: отдельно для настоящей речи и для подделки. Bournemouth Forced Aligner дает границы фонем, после чего attribution scores агрегируются по фонемам и non-speech segments. Значимость проверяется Kruskal-Wallis tests с Benjamini-Hochberg correction, а величина эффекта измеряется epsilon-squared.
Результаты. Пуловая EER детектора на ASVspoof 5 равна 8.52%; большинство атак дает EER ниже 8%, но A24 и A28 превышают 20%, что показывает разную трудность генераторов. Фонемный анализ выявляет attack-dependent важность: для spoof-CAM наиболее сильные эффекты у /oU/ (epsilon2 0.135), /E/ (0.115), /AI/ (0.113), /s/ (0.101) и /f/ (0.098). Все top-25 phonemes по normalized spoof-CAM имеют значимые различия между атаками после поправки pBH < 0.001.
Ограничения. Grad-CAM показывает коррелирующие области внимания модели, но не доказывает причинность акустических признаков. Выравнивание фонем автоматическое и может ошибаться, особенно на поддельной речи. Работа англоязычная и привязана к одному типу детектора; для многоязычных сценариев и других архитектур выводы надо перепроверять.
Фишка из статьи. Особенно интересен temporal result: настоящая речь и подделка дают пики важности в разных местах фонемы. Детектор, похоже, использует переходы между фонемами для bona fide и более стационарные участки внутри фонем для spoof.
| Наблюдение | Число из статьи | Интерпретация |
|---|---|---|
| Bona fide activation peaks | примерно 10-15 ms от границы фонемы | важны переходы между звуками |
| Spoof activation peaks | примерно 37-56 ms внутри фонемы | важны steady-state реализации |
| Non-speech attribution mass | 7-25% | паузы и молчание тоже несут сигнал |
| Attack-pair differences | 124 из 136 пар значимы | разные генераторы оставляют разные следы |
Как это читать: «универсальной фонемы дипфейка» нет. Детектор видит сочетание атаки, диктора, фонетического класса и позиции внутри звука; это хороший аргумент за анализ ошибок по фонемам, а не только по среднему EER.