анонимизация голоса клонирование голоса приватность
arXiv cs.SD

Your Voice Cloning System is Secretly a Voice Anonymizer

arXiv:2608.27360

Авторы показывают, что готовую систему клонирования голоса можно развернуть в обратную сторону: сохранить слова и просодию, но заменить личность говорящего на правдоподобный псевдоголос. Важен практический минимализм — XTTSv2 не переобучают, а многопроходная схема выбирает лучший компромисс между разборчивостью и удалением исходной личности.

Метод. Whisper large-v3 даёт текст, кодировщик XTTS извлекает просодическое представление, ECAPA2 — признаки личности, а HiFi-GAN восстанавливает звук. Псевдоговорящий выбирается из пула десяти голосов того же языка и указанного пола. Преобразование повторяется до четырёх раз; выбирается итерация с максимальным гармоническим средним между 1−WER и 1−сходством с исходным голосом.

Результаты. На Common Voice по семи европейским языкам XTTS-вариант достигает EER 0,49 при WER 0,16 и даже повышает UTMOS на 0,17 относительно исходного звука. На MLS получены EER 0,46, WER 0,16 и ΔUTMOS −0,35; это лучше по качеству, чем SALT и MultiLingual Voice Privacy, у которых падение UTMOS достигает −1,29 и −1,23. В английском прослушивании MLS сравнительная MOS равна −0,90 ± 1,39 против −1,00 ± 1,12 у SALT.

Ограничения. ECAPA2 участвует и в выборе псевдоголоса, и в оценке сходства, что благоприятствует именно этому определителю говорящего. Нет атаки осведомлённого противника, проверки связи нескольких анонимизированных записей и языков вне Европы. Прослушивание охватывает лишь 30 английских примеров, а многократный прогон и выбор по WER увеличивают стоимость.

Фишка из статьи. Анонимизация не сводится к одному проходу: оптимум распределён по всем итерациям. Для 19,6% файлов лучшим остаётся исходный результат до повторного преобразования, а чаще всего, в 25% случаев, выбирается четвёртый проход. Значит, фиксированное число преобразований систематически переанонимизирует одни записи и недоанонимизирует другие.

Набор и методEERWERИзменение UTMOS
Common Voice, SALT0,370,26−0,74
Common Voice, MultiLingual0,460,27−0,62
Common Voice, XTTS0,490,16+0,17
MLS, SALT0,300,13−1,29
MLS, MultiLingual0,440,17−1,23
MLS, XTTS0,460,16−0,35

Как это читать: для EER здесь больше означает, что проверять исходного говорящего труднее; для WER и потери UTMOS меньше лучше. XTTS даёт сильный баланс на этих определителях, но таблица не заменяет проверку против другого распознавателя личности и целевой атаки.

Оригинальная статья на arXiv