Акустические и содержательные атаки на многоязычную анонимизацию голоса
Работа проверяет, чем атаковать многоязычную анонимизацию: глобальными акустическими признаками диктора или представлениями, сильнее связанными с речевым содержанием. Ответ зависит от полезности анонимизированной речи, но в целом акустический атакующий заметно сильнее, особенно когда синтез искажает фонетику.
Метод. Два верификатора сравниваются на шести языках в ленивом и полуинформированном сценариях. Для переноса между языками авторы строят MultiVC: 714 462 преобразованных фразы от семи систем преобразования голоса, 4474 целевых дикторов и 70 113 исходных фраз. Низкий EER означает успешную повторную идентификацию и, следовательно, слабую приватность.
Результаты. Для BM1 акустический WavLM-ECAPA после обучения на MultiVC достигает среднего EER 8,99% против 17,66% у содержательного w2v-BERT-MFA. В полуинформированной атаке BM1 разрыв составляет 3,66% против 8,09%. На более искажённом BM2 EER растёт до 24,83% и 38,97%; одновременно японский CER достигает 45,1%, а китайский 70,3%.
Ограничения. Параллель между потерей разборчивости и ослаблением атаки корреляционная, а не причинная. Протокол охватывает две схемы анонимизации и шесть языков, причём WER и CER несопоставимы напрямую. Огромный синтетический MultiVC может переносить особенности семи выбранных преобразователей.
Фишка из статьи. Высокий EER на восточноазиатских языках выглядит как хорошая приватность, но возникает вместе с разрушением содержания. Без совместного отчёта WER/CER такой результат легко принять за успех анонимизации.
| Язык | BM1 WER/CER, % | BM2 WER/CER, % |
|---|---|---|
| Английский, WER | 5,4 | 16,0 |
| Французский, WER | 13,2 | 44,9 |
| Японский, CER | 9,7 | 45,1 |
| Китайский, CER | 30,2 | 70,3 |
Как это читать: более слабая повторная идентификация BM2 отчасти покупается неприемлемой потерей речи. Приватность следует измерять при сопоставимой полезности, а атакующего выбирать с учётом того, сколько фонетической структуры система сохранила.