Гендерный сдвиг в детекторах голосовых дипфейков
Статья проверяет важный риск для детекторов поддельной речи: хорошая средняя точность может скрывать систематически худшую защиту для одной гендерной группы. Авторы не просто меряют bias на фиксированном датасете, а варьируют гендерный состав обучения как независимую переменную. Главный вывод практический: недопредставленная группа почти всегда получает больший EER, а калибровка порогов не закрывает структурный разрыв в распределениях score.
Метод. Работа использует ASVspoof5, но строит контролируемый custom split: для каждой атаки и гендера все utterances объединяются и заново делятся 70/10/20 на train/dev/eval. Обучаются attack-specific ResNet18-детекторы на LogSpectrogram и WavLM-Base+ признаках. Всего авторы получают 384 модели: 288 WavLM-Base+ на девяти гендерных составах и 96 LogSpectrogram на трех базовых составах. Оценка идет по EER и шести fairness-метрикам, затем применяются шесть post-hoc стратегий калибровки, включая Oracle с доступом к test labels.
Результаты. Гендерный состав обучения предсказывает направление ошибки: в 31 из 32 атак хуже работает группа, которая была недопредставлена при обучении. WavLM-Base+ дает гендерные разрывы в 3.0-4.3 раза больше, чем LogSpectrogram при одинаковом составе данных; балансировка почти убирает разрыв у LogSpectrogram, но оставляет заметный разрыв у WavLM. Combined training снижает средний EER gap с 1.042 до 0.273 п.п. по сравнению с within-attack balancing при похожем соотношении полов. При этом все шесть калибровок оставляют EER gap неизменным: 1.317 п.п.
Ограничения. Custom split нужен для причинного контроля состава, но он не сопоставим с официальным leaderboard ASVspoof5. Разбиения не гарантируют speaker-disjointness, потому что speaker IDs недоступны в нужном виде, и возможное пересечение говорящих остается неизвестным. Анализ бинарный, только female/male по протоколу ASVspoof5; другие идентичности и пересечения факторов не покрыты. Также сравниваются только два типа признаков, а все mitigation-эксперименты являются post-hoc, без изменения обучения.
Фишка из статьи. Наиболее сильный отрицательный результат - калибровка порогов может улучшать одну fairness-метрику, но EER gap не трогает вообще. Даже Oracle-калибровка с доступом к меткам evaluation set не меняет 1.317 п.п.
| Калибровка | EER gap | FPR gap | SPD | EOpD |
|---|---|---|---|---|
| TC0 | 1.317 | 0.0152 | 0.0237 | 0.0124 |
| TC EER | 1.317 | 0.0137 | 0.0276 | 0.0136 |
| TC FPR | 1.317 | 0.0001 | 0.0293 | 0.0301 |
| TC TPR | 1.317 | 0.0261 | 0.0304 | 0.0001 |
| Oracle | 1.317 | 0.0132 | 0.0268 | 0.0132 |
Как это читать: TC FPR почти выравнивает false alarms, а TC TPR почти выравнивает detection rate, но форма ROC-распределений между группами не меняется. Поэтому EER gap остается тем же, и честность детектора надо чинить на уровне данных, представлений или функции потерь, а не только порогом.