Извлечение стиля голоса из frozen TTS без reference encoder
Работа показывает чувствительный, но технически важный сценарий: если синтезатор речи принимает style vector, но не публикует reference encoder, этот вектор все равно можно подобрать градиентной оптимизацией. Все веса frozen TTS и WavLM остаются неизменными, оптимизируется только входной вектор стиля по одной записи целевого голоса. Это полезно читать как анализ поверхности атаки и ограничений открытых TTS-релизов, а не как практическое руководство по клонированию.
Метод. Автор синтезирует несколько фиксированных английских фраз, сравнивает time-pooled WavLM layer-4 statistics с целевой записью и обновляет только style vector. Объектив специально отбрасывает временную ось, поэтому не нужен текст целевой записи и не требуется выравнивание. Оптимизация начинается с ближайшего preset-голоса и идет Adam с learning rate 2e-4, gradient clipping и несколькими подсказками для фонемного покрытия.
Результаты. На 154 дикторах из двух корпусов ECAPA-TDNN similarity растет с 0.132 у ближайшего preset до 0.413 после оптимизации, ResNet similarity - с 0.099 до 0.401, WavLM similarity - с 0.713 до 0.836. Улучшение есть у всех 154 дикторов по ECAPA и ResNet. Средняя стоимость batch-режима - 0.49 минуты на диктора на RTX 3090, а средняя сходимость - 375 шагов, диапазон 80-1275.
Ограничения. Метод наследует темп и длительность от initializing preset, потому что duration style не имеет градиентного пути в используемом графе. WER немного растет: 1.84% у preset против 3.19% после оптимизации, причем часть ошибки идет от нестабильности самого синтезатора. Авторы не проверяют spoofing countermeasures и прямо отмечают этический риск; без согласия диктора такой метод нельзя считать безопасным сценарием применения.
Фишка из статьи. Самый сильный результат - не средняя похожесть, а проверка через верификатор диктора. Она переводит cosine similarity в практический риск: будет ли система принимать синтезированный голос как целевой.
| Operating point | Порог | Genuine accepted | Extracted accepted | Preset accepted |
|---|---|---|---|---|
| EER 0.9% | 0.406 | 99.1% | 52.6% | 1.3% |
| FAR 5% | 0.290 | 100.0% | 85.7% | 9.1% |
| FAR 1% | 0.399 | 100.0% | 53.9% | 1.9% |
| FAR 0.1% | 0.519 | 92.7% | 18.8% | 0.0% |
Как это читать: ближайший preset почти никогда не проходит как целевой диктор, а оптимизированный style vector проходит в 52.6% случаев при рабочей точке EER. Это говорит не о качестве речи как таковой, а о том, что входной style vector является реальной поверхностью для извлечения личности диктора.