Your Voice Cloning System is Secretly a Voice Anonymizer
Авторы показывают, что готовую систему клонирования голоса можно развернуть в обратную сторону: сохранить слова и просодию, но заменить личность говорящего на правдоподобный псевдоголос. Важен практический минимализм — XTTSv2 не переобучают, а многопроходная схема выбирает лучший компромисс между разборчивостью и удалением исходной личности.
Метод. Whisper large-v3 даёт текст, кодировщик XTTS извлекает просодическое представление, ECAPA2 — признаки личности, а HiFi-GAN восстанавливает звук. Псевдоговорящий выбирается из пула десяти голосов того же языка и указанного пола. Преобразование повторяется до четырёх раз; выбирается итерация с максимальным гармоническим средним между 1−WER и 1−сходством с исходным голосом.
Результаты. На Common Voice по семи европейским языкам XTTS-вариант достигает EER 0,49 при WER 0,16 и даже повышает UTMOS на 0,17 относительно исходного звука. На MLS получены EER 0,46, WER 0,16 и ΔUTMOS −0,35; это лучше по качеству, чем SALT и MultiLingual Voice Privacy, у которых падение UTMOS достигает −1,29 и −1,23. В английском прослушивании MLS сравнительная MOS равна −0,90 ± 1,39 против −1,00 ± 1,12 у SALT.
Ограничения. ECAPA2 участвует и в выборе псевдоголоса, и в оценке сходства, что благоприятствует именно этому определителю говорящего. Нет атаки осведомлённого противника, проверки связи нескольких анонимизированных записей и языков вне Европы. Прослушивание охватывает лишь 30 английских примеров, а многократный прогон и выбор по WER увеличивают стоимость.
Фишка из статьи. Анонимизация не сводится к одному проходу: оптимум распределён по всем итерациям. Для 19,6% файлов лучшим остаётся исходный результат до повторного преобразования, а чаще всего, в 25% случаев, выбирается четвёртый проход. Значит, фиксированное число преобразований систематически переанонимизирует одни записи и недоанонимизирует другие.
| Набор и метод | EER | WER | Изменение UTMOS |
|---|---|---|---|
| Common Voice, SALT | 0,37 | 0,26 | −0,74 |
| Common Voice, MultiLingual | 0,46 | 0,27 | −0,62 |
| Common Voice, XTTS | 0,49 | 0,16 | +0,17 |
| MLS, SALT | 0,30 | 0,13 | −1,29 |
| MLS, MultiLingual | 0,44 | 0,17 | −1,23 |
| MLS, XTTS | 0,46 | 0,16 | −0,35 |
Как это читать: для EER здесь больше означает, что проверять исходного говорящего труднее; для WER и потери UTMOS меньше лучше. XTTS даёт сильный баланс на этих определителях, но таблица не заменяет проверку против другого распознавателя личности и целевой атаки.