Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models
Донастроенная система синтеза речи может выдать не только голос, но и факт присутствия конкретного диктора или конкретной записи в обучающем наборе. Работа интересна тем, что рассматривает полностью закрытый доступ к трём современным системам синтеза и показывает два разных канала утечки: голосовую принадлежность лучше выдаёт генератор, а принадлежность отдельной записи — языковая часть модели.
Метод. Атакующий подаёт текстовые запросы в CosyVoice2, F5-TTS и XTTS-v2, получает синтезированную речь и сравнивает её признаки с проверяемым образцом. Для уровня диктора достаточно вложений системы распознавания говорящего; для уровня записи авторы объединяют признаки нескольких слоёв WavLM и выравнивают эталон с ответом с помощью динамического программирования по времени. Проверка проведена на VCTK и British Dialect Corpus, отдельно для разных запросов и бюджетов обращений.
Результаты. Лучший запрос, заставляющий модель произнести проверяемую фразу, даёт AUC 0,980 для членства диктора и 0,896 для отдельной записи. Для записи многослойные признаки WavLM заметно сильнее вложения диктора: 0,896 против 0,808 AUC. Пять запросов почти насыщают атаку на диктора, тогда как для уверенного решения по записи требуется около десяти. Обучение с DP-SGD при ε=4 или 10 снижает AUC примерно до 0,52–0,54, но статья не измеряет, какую цену за это платит качество синтеза.
Ограничения. Эксперимент охватывает только три архитектуры и два англоязычных набора, а пороги атаки предполагают доступ к теневым моделям с похожим обучением. Добавление шума и усечение ответа не дают надёжной защиты. Дифференциальная приватность выглядит убедительно по утечке, однако без MOS, разборчивости и устойчивости нельзя считать найденный режим практически готовой мерой защиты.
Фишка из статьи. Для атаки на отдельную запись критично не просто извлечь хороший речевой признак, а правильно сопоставить его по времени с синтезированным ответом.
| Способ выравнивания | AUC | Точность |
|---|---|---|
| Динамическое выравнивание по времени | 0,896 | 0,809 |
| Поиск временного сдвига | 0,807 | 0,737 |
| Равномерное растяжение | 0,697 | 0,648 |
Как это читать: выигрыш динамического выравнивания показывает, что утечка хранится в локальной акустической структуре фразы. Грубое совпадение длительности теряет значительную часть сигнала, даже когда признаки и классификатор остаются теми же.