анонимизация голоса приватность преобразование голоса
arXiv eess.AS

Простая анонимизация голоса без обучения с проекционным classifier-free guidance

arXiv:2610.08276

Работа показывает, что для усиления анонимизации необязательно переобучать модель преобразования голоса. Авторы вмешиваются только в вывод готовой flow-matching-модели: сначала строят условие, слабо связанное с исходным диктором, затем проецируют направление генерации так, чтобы подавить остаточную компоненту исходной личности.

Метод. На первом этапе авторегрессионная часть Seed-VC v2 пересобирает содержание исходной фразы в контексте случайного целевого голоса. На втором этапе projected classifier-free guidance оценивает направление, которое возвращает генерацию к исходному диктору, и вычитает его из условного вектора. Сглаженный вариант Smooth-21 усредняет направление в локальном окне, уменьшая артефакты покадровой проекции.

Результаты. На оценочном наборе VoicePrivacy 2026 Smooth-21 повышает EER ленивого атакующего с 28,19% до 29,39%, а полуинформированного с 17,78% до 21,51% относительно штатной анонимизации Seed-VC. При этом WER даже немного ниже, 4,46% против 4,58%; UAR распознавания эмоций составляет 39,57% против 40,38%. Лучший официальный базовый вариант B5 даёт 25,65% и 17,05% EER при WER 4,44%.

Ограничения. Абсолютный запас приватности остаётся умеренным: полуинформированный атакующий всё ещё распознаёт говорящего заметно лучше случайного уровня. Рабочая точка выбрана по 30 фразам и порогу WER 5%, поэтому баланс приватности и полезности зависит от этого прикладного выбора. Эксперимент привязан к Seed-VC v2 и протоколу VoicePrivacy.

Фишка из статьи. Два шага дают независимый вклад: случайный целевой контекст помогает даже при неизменных коэффициентах guidance, а проекция улучшает приватность даже без случайного контекста.

Вариант на developmentEER, %WER, %
Штатная анонимизация33,154,18
Smooth-21 без случайной цели34,204,39
Smooth-21 со случайной целью, те же масштабы34,794,47
Smooth-21 со случайной целью, настройка масштабов35,094,52

Как это читать: рост EER означает более трудную верификацию личности. Здесь приватность складывается из ослабления исходного диктора в авторегрессионном условии и удаления его направления при генерации, а не из одного удачно подобранного коэффициента.

Оригинальная статья на arXiv