Синтез речи Style vector Speaker similarity
Синтез речи

Извлечение стиля голоса из frozen TTS без reference encoder

SIM_E 0.413

Работа показывает чувствительный, но технически важный сценарий: если синтезатор речи принимает style vector, но не публикует reference encoder, этот вектор все равно можно подобрать градиентной оптимизацией. Все веса frozen TTS и WavLM остаются неизменными, оптимизируется только входной вектор стиля по одной записи целевого голоса. Это полезно читать как анализ поверхности атаки и ограничений открытых TTS-релизов, а не как практическое руководство по клонированию.

Метод. Автор синтезирует несколько фиксированных английских фраз, сравнивает time-pooled WavLM layer-4 statistics с целевой записью и обновляет только style vector. Объектив специально отбрасывает временную ось, поэтому не нужен текст целевой записи и не требуется выравнивание. Оптимизация начинается с ближайшего preset-голоса и идет Adam с learning rate 2e-4, gradient clipping и несколькими подсказками для фонемного покрытия.

Результаты. На 154 дикторах из двух корпусов ECAPA-TDNN similarity растет с 0.132 у ближайшего preset до 0.413 после оптимизации, ResNet similarity - с 0.099 до 0.401, WavLM similarity - с 0.713 до 0.836. Улучшение есть у всех 154 дикторов по ECAPA и ResNet. Средняя стоимость batch-режима - 0.49 минуты на диктора на RTX 3090, а средняя сходимость - 375 шагов, диапазон 80-1275.

Ограничения. Метод наследует темп и длительность от initializing preset, потому что duration style не имеет градиентного пути в используемом графе. WER немного растет: 1.84% у preset против 3.19% после оптимизации, причем часть ошибки идет от нестабильности самого синтезатора. Авторы не проверяют spoofing countermeasures и прямо отмечают этический риск; без согласия диктора такой метод нельзя считать безопасным сценарием применения.

Фишка из статьи. Самый сильный результат - не средняя похожесть, а проверка через верификатор диктора. Она переводит cosine similarity в практический риск: будет ли система принимать синтезированный голос как целевой.

Operating pointПорогGenuine acceptedExtracted acceptedPreset accepted
EER 0.9%0.40699.1%52.6%1.3%
FAR 5%0.290100.0%85.7%9.1%
FAR 1%0.399100.0%53.9%1.9%
FAR 0.1%0.51992.7%18.8%0.0%

Как это читать: ближайший preset почти никогда не проходит как целевой диктор, а оптимизированный style vector проходит в 52.6% случаев при рабочей точке EER. Это говорит не о качестве речи как таковой, а о том, что входной style vector является реальной поверхностью для извлечения личности диктора.

Оригинальная статья на arXiv