Deepfake Диктор Диагностика
Детекция поддельной речи

ISS: когда детектор поддельной речи смотрит на диктора, а не на артефакт

AUC 0.954

Статья показывает, что сильные детекторы поддельной речи могут частично опираться на личность диктора, а не только на артефакты синтеза. Это опасно для переноса между корпусами: если в обучении реальные и синтетические примеры связаны с разными дикторами, модель может выучить shortcut. Авторы предлагают Identity Sensitivity Score, или ISS, - метрику, которая без разметки на инференсе оценивает, насколько решение детектора меняется при разных дикторских контекстах.

Метод не генерирует новый звук и не прогоняет детектор много раз по измененному аудио. Базовый score переводится в logit-пространство, к нему добавляется alpha умноженное на косинусную близость между ECAPA-TDNN-эмбеддингом входного аудио и прототипом альтернативного диктора, после чего score возвращается через sigmoid. Для одного файла берут K=10 альтернативных дикторов и считают межквартильный размах полученных вероятностей fake. Чем выше ISS, тем сильнее решение зависит от дикторского контекста.

На ASVspoof 2019 LA AASIST имеет EER 0.83%, но на ASVspoof 2021 LA без дообучения падает до 17.39% EER - рост ошибки в 21 раз. RawNet2 стартует хуже на 2019 LA, 4.11% EER, но сдвигается до 12.41% на 2021 LA. ISS хорошо отделяет правильные и ошибочные решения: для AASIST на 2019 LA медианный ISS у ошибок в 29 раз выше, чем у верных решений, а AUC предсказания ошибки по ISS равен 0.954; для RawNet2 - отношение 52x и AUC 0.918. На 2021 LA AUC остается выше 0.84 для обоих детекторов.

Ограничения важны для внедрения. ISS зависит от внешней модели диктора ECAPA-TDNN и от выбранного logit-space perturbation, то есть измеряет чувствительность к той геометрии дикторов, которую видит ECAPA. Для настройки alpha и прототипов нужен небольшой размеченный development set, хотя сам инференс label-free. Кроме того, авторы проверяют только AASIST и RawNet2; для SSL-детекторов и других частей ASVspoof механизм может выглядеть иначе.

Фишка из статьи. Убедительная часть - voice-conversion validation: авторы проверили, что высокий ISS действительно связан с чувствительностью к диктору, а не просто с близостью к порогу классификации.

ДетекторHigh-ISS mean ΔscoreLow-ISS mean ΔscoreРазницаSpearman rho
AASIST0.10690.005619.2x0.846
RawNet20.04010.001330.7x0.806

Как это читать: если взять корректно классифицированные настоящие записи и прогнать voice conversion, то записи с высоким ISS намного сильнее меняют score детектора. Это делает ISS не просто еще одной мерой неуверенности, а диагностикой конкретного failure mode - зависимости решения от дикторской идентичности.

Оригинальная статья на arXiv