Простая анонимизация голоса без обучения с проекционным classifier-free guidance
Работа показывает, что для усиления анонимизации необязательно переобучать модель преобразования голоса. Авторы вмешиваются только в вывод готовой flow-matching-модели: сначала строят условие, слабо связанное с исходным диктором, затем проецируют направление генерации так, чтобы подавить остаточную компоненту исходной личности.
Метод. На первом этапе авторегрессионная часть Seed-VC v2 пересобирает содержание исходной фразы в контексте случайного целевого голоса. На втором этапе projected classifier-free guidance оценивает направление, которое возвращает генерацию к исходному диктору, и вычитает его из условного вектора. Сглаженный вариант Smooth-21 усредняет направление в локальном окне, уменьшая артефакты покадровой проекции.
Результаты. На оценочном наборе VoicePrivacy 2026 Smooth-21 повышает EER ленивого атакующего с 28,19% до 29,39%, а полуинформированного с 17,78% до 21,51% относительно штатной анонимизации Seed-VC. При этом WER даже немного ниже, 4,46% против 4,58%; UAR распознавания эмоций составляет 39,57% против 40,38%. Лучший официальный базовый вариант B5 даёт 25,65% и 17,05% EER при WER 4,44%.
Ограничения. Абсолютный запас приватности остаётся умеренным: полуинформированный атакующий всё ещё распознаёт говорящего заметно лучше случайного уровня. Рабочая точка выбрана по 30 фразам и порогу WER 5%, поэтому баланс приватности и полезности зависит от этого прикладного выбора. Эксперимент привязан к Seed-VC v2 и протоколу VoicePrivacy.
Фишка из статьи. Два шага дают независимый вклад: случайный целевой контекст помогает даже при неизменных коэффициентах guidance, а проекция улучшает приватность даже без случайного контекста.
| Вариант на development | EER, % | WER, % |
|---|---|---|
| Штатная анонимизация | 33,15 | 4,18 |
| Smooth-21 без случайной цели | 34,20 | 4,39 |
| Smooth-21 со случайной целью, те же масштабы | 34,79 | 4,47 |
| Smooth-21 со случайной целью, настройка масштабов | 35,09 | 4,52 |
Как это читать: рост EER означает более трудную верификацию личности. Здесь приватность складывается из ослабления исходного диктора в авторегрессионном условии и удаления его направления при генерации, а не из одного удачно подобранного коэффициента.