Дипфейки Фонемы Grad-CAM
Голосовые дипфейки

Фонемные объяснения для детекторов голосовых дипфейков

EER 8.52%

Статья не пытается просто улучшить точность детектора голосовых дипфейков, а спрашивает, на какие фонетические участки он реально опирается. Авторы совмещают WavLM-based detector, сверточный классификатор, Grad-CAM и принудительное фонемное выравнивание, чтобы перевести saliency maps в фонемы, паузы и позиции внутри фонем. Это полезно для доверия к детекторам: можно увидеть не только «spoof или bona fide», но и какие звуковые единицы создают решение.

Метод. Детектор обучается на ASVspoof 5, затем для evaluation set извлекаются class-specific Grad-CAM карты: отдельно для настоящей речи и для подделки. Bournemouth Forced Aligner дает границы фонем, после чего attribution scores агрегируются по фонемам и non-speech segments. Значимость проверяется Kruskal-Wallis tests с Benjamini-Hochberg correction, а величина эффекта измеряется epsilon-squared.

Результаты. Пуловая EER детектора на ASVspoof 5 равна 8.52%; большинство атак дает EER ниже 8%, но A24 и A28 превышают 20%, что показывает разную трудность генераторов. Фонемный анализ выявляет attack-dependent важность: для spoof-CAM наиболее сильные эффекты у /oU/ (epsilon2 0.135), /E/ (0.115), /AI/ (0.113), /s/ (0.101) и /f/ (0.098). Все top-25 phonemes по normalized spoof-CAM имеют значимые различия между атаками после поправки pBH < 0.001.

Ограничения. Grad-CAM показывает коррелирующие области внимания модели, но не доказывает причинность акустических признаков. Выравнивание фонем автоматическое и может ошибаться, особенно на поддельной речи. Работа англоязычная и привязана к одному типу детектора; для многоязычных сценариев и других архитектур выводы надо перепроверять.

Фишка из статьи. Особенно интересен temporal result: настоящая речь и подделка дают пики важности в разных местах фонемы. Детектор, похоже, использует переходы между фонемами для bona fide и более стационарные участки внутри фонем для spoof.

НаблюдениеЧисло из статьиИнтерпретация
Bona fide activation peaksпримерно 10-15 ms от границы фонемыважны переходы между звуками
Spoof activation peaksпримерно 37-56 ms внутри фонемыважны steady-state реализации
Non-speech attribution mass7-25%паузы и молчание тоже несут сигнал
Attack-pair differences124 из 136 пар значимыразные генераторы оставляют разные следы

Как это читать: «универсальной фонемы дипфейка» нет. Детектор видит сочетание атаки, диктора, фонетического класса и позиции внутри звука; это хороший аргумент за анализ ошибок по фонемам, а не только по среднему EER.

Оригинальная статья на arXiv