Верификация диктора Анонимизация Privacy
Speaker privacy

Много фраз ломают анонимизацию диктора

EER 37.59->22.63

Эта работа полезна как проверка реальной прочности анонимизации речи: атакующий не обязан сравнивать одну фразу с одной фразой. Авторы показывают, что если собрать несколько высказываний и добавить текстовую информацию, равенство диктора восстанавливается заметно лучше. Главный ход - перейти от одиночной верификации к многофразовой и мультимодальной атаке, где речь, просодия и расшифровка работают совместно.

Метод. Базовый признак диктора строится на WavLM-ECAPA, а поверх него сравниваются несколько стратегий агрегации: среднее по высказываниям, attention на уровне фразы и конкатенация на уровне кадров. Для текста авторы используют автоматические расшифровки, когда ручных нет; в статье отдельно указано, что такой канал имеет WER около 21%, то есть атака не опирается на идеальный текст. Рассматриваются режимы original-original, original-anonymized и anonymized-anonymized, включая semi-informed настройку на анонимизированных данных.

Результаты. В сценарии anonymized-anonymized semi-informed frame-level модель снижает EER до 6.96% при 15 высказываниях, тогда как WavLM-ECAPA со средним дает 13.70%. В lazy-режиме аудио само по себе слабее: при 15 фразах audio-only mean pooling дает EER 37.59%, но смесь audio+text с весами 0.5/0.5 снижает его до 22.63%. Это значит, что анонимизация, которая выглядит приемлемой на одиночных парах, может протекать через накопление слабых признаков.

Ограничения. Результат зависит от качества автоматических расшифровок и от того, насколько текстовые темы коррелируют с диктором в конкретном корпусе. Semi-informed атака предполагает доступ к данным похожей анонимизации, что не всегда реалистично. Статья оценивает EER, но не дает полного анализа privacy-utility trade-off для систем, где анонимизация нужна вместе с распознаванием или диалоговой аналитикой.

Фишка из статьи. Сильный сигнал здесь - накопление идентичности по числу фраз. Даже без semi-informed обучения мультимодальная атака постепенно вытаскивает диктора из анонимизированной речи.

Lazy A-A атака5 фраз10 фраз15 фраз
Audio-only, mean pooling45.10% EER40.26% EER37.59% EER
Text-only, learned aggregation43.87% EER34.97% EER28.20% EER
Audio+Text, concat38.69% EER30.06% EER23.91% EER
Audio+Text, 0.5A+0.5T37.18% EER28.02% EER22.63% EER

Как это читать: EER должен быть ближе к 50%, если анонимизация хорошо скрывает диктора. Падение до 22.63% при 15 фразах показывает, что приватность надо оценивать на уровне сессий и архивов, а не только отдельных utterance-пар.

Оригинальная статья на arXiv