синтез речи конфиденциальность атака на модель
arXiv cs.CR

Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models

arXiv:2609.01723

Донастроенная система синтеза речи может выдать не только голос, но и факт присутствия конкретного диктора или конкретной записи в обучающем наборе. Работа интересна тем, что рассматривает полностью закрытый доступ к трём современным системам синтеза и показывает два разных канала утечки: голосовую принадлежность лучше выдаёт генератор, а принадлежность отдельной записи — языковая часть модели.

Метод. Атакующий подаёт текстовые запросы в CosyVoice2, F5-TTS и XTTS-v2, получает синтезированную речь и сравнивает её признаки с проверяемым образцом. Для уровня диктора достаточно вложений системы распознавания говорящего; для уровня записи авторы объединяют признаки нескольких слоёв WavLM и выравнивают эталон с ответом с помощью динамического программирования по времени. Проверка проведена на VCTK и British Dialect Corpus, отдельно для разных запросов и бюджетов обращений.

Результаты. Лучший запрос, заставляющий модель произнести проверяемую фразу, даёт AUC 0,980 для членства диктора и 0,896 для отдельной записи. Для записи многослойные признаки WavLM заметно сильнее вложения диктора: 0,896 против 0,808 AUC. Пять запросов почти насыщают атаку на диктора, тогда как для уверенного решения по записи требуется около десяти. Обучение с DP-SGD при ε=4 или 10 снижает AUC примерно до 0,52–0,54, но статья не измеряет, какую цену за это платит качество синтеза.

Ограничения. Эксперимент охватывает только три архитектуры и два англоязычных набора, а пороги атаки предполагают доступ к теневым моделям с похожим обучением. Добавление шума и усечение ответа не дают надёжной защиты. Дифференциальная приватность выглядит убедительно по утечке, однако без MOS, разборчивости и устойчивости нельзя считать найденный режим практически готовой мерой защиты.

Фишка из статьи. Для атаки на отдельную запись критично не просто извлечь хороший речевой признак, а правильно сопоставить его по времени с синтезированным ответом.

Способ выравниванияAUCТочность
Динамическое выравнивание по времени0,8960,809
Поиск временного сдвига0,8070,737
Равномерное растяжение0,6970,648

Как это читать: выигрыш динамического выравнивания показывает, что утечка хранится в локальной акустической структуре фразы. Грубое совпадение длительности теряет значительную часть сигнала, даже когда признаки и классификатор остаются теми же.

Оригинальная статья на arXiv