Fairness ASVspoof5 WavLM
Голосовые дипфейки

Гендерный сдвиг в детекторах голосовых дипфейков

gap 1.317 pp

Статья проверяет важный риск для детекторов поддельной речи: хорошая средняя точность может скрывать систематически худшую защиту для одной гендерной группы. Авторы не просто меряют bias на фиксированном датасете, а варьируют гендерный состав обучения как независимую переменную. Главный вывод практический: недопредставленная группа почти всегда получает больший EER, а калибровка порогов не закрывает структурный разрыв в распределениях score.

Метод. Работа использует ASVspoof5, но строит контролируемый custom split: для каждой атаки и гендера все utterances объединяются и заново делятся 70/10/20 на train/dev/eval. Обучаются attack-specific ResNet18-детекторы на LogSpectrogram и WavLM-Base+ признаках. Всего авторы получают 384 модели: 288 WavLM-Base+ на девяти гендерных составах и 96 LogSpectrogram на трех базовых составах. Оценка идет по EER и шести fairness-метрикам, затем применяются шесть post-hoc стратегий калибровки, включая Oracle с доступом к test labels.

Результаты. Гендерный состав обучения предсказывает направление ошибки: в 31 из 32 атак хуже работает группа, которая была недопредставлена при обучении. WavLM-Base+ дает гендерные разрывы в 3.0-4.3 раза больше, чем LogSpectrogram при одинаковом составе данных; балансировка почти убирает разрыв у LogSpectrogram, но оставляет заметный разрыв у WavLM. Combined training снижает средний EER gap с 1.042 до 0.273 п.п. по сравнению с within-attack balancing при похожем соотношении полов. При этом все шесть калибровок оставляют EER gap неизменным: 1.317 п.п.

Ограничения. Custom split нужен для причинного контроля состава, но он не сопоставим с официальным leaderboard ASVspoof5. Разбиения не гарантируют speaker-disjointness, потому что speaker IDs недоступны в нужном виде, и возможное пересечение говорящих остается неизвестным. Анализ бинарный, только female/male по протоколу ASVspoof5; другие идентичности и пересечения факторов не покрыты. Также сравниваются только два типа признаков, а все mitigation-эксперименты являются post-hoc, без изменения обучения.

Фишка из статьи. Наиболее сильный отрицательный результат - калибровка порогов может улучшать одну fairness-метрику, но EER gap не трогает вообще. Даже Oracle-калибровка с доступом к меткам evaluation set не меняет 1.317 п.п.

КалибровкаEER gapFPR gapSPDEOpD
TC01.3170.01520.02370.0124
TC EER1.3170.01370.02760.0136
TC FPR1.3170.00010.02930.0301
TC TPR1.3170.02610.03040.0001
Oracle1.3170.01320.02680.0132

Как это читать: TC FPR почти выравнивает false alarms, а TC TPR почти выравнивает detection rate, но форма ROC-распределений между группами не меняется. Поэтому EER gap остается тем же, и честность детектора надо чинить на уровне данных, представлений или функции потерь, а не только порогом.

Оригинальная статья на arXiv