Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction
Работа учит японский синтез речи выполнять словесные указания вроде «мягче» или «энергичнее», не требуя для каждого указания пары профессионально записанных голосов. Главный ход — построить сотни тысяч псевдотроек «исходный голос — указание — изменённый голос» через пространство из 13 впечатлений о голосе, а затем обучить небольшой преобразователь вложений на основе rectified flow, не меняя основную систему синтеза.
Метод. Управляемый синтезатор создаёт модифицированную речь из 13-мерного вектора впечатлений, а Qwen формулирует направление изменения. Так собрано 350 617 псевдотроек от 1600 говорящих, 127,6 часа уникальной речи; отдельный реальный набор содержит 6899 пар профессиональных актёров. Исправитель стиля обучается методом rectified flow в пространстве голосовых вложений, после чего замороженный синтезатор произносит новый текст.
Результаты. На незнакомых говорящих полная смесь данных получает UTMOS 2,97 и оценку следования указанию 3,24. Только реальные пары лучше следуют направлению по субъективной оценке, 3,48 против 3,32 у полной системы, но хуже сохраняют сходство с исходным голосом: 2,63 против 3,22. Только псевдоданные дают сходство 3,24 и следование 3,18. В прослушивании участвовали 258 и 208 оценщиков, не менее десяти на пример.
Ограничения. Все данные японские, а основная модель обучена на закрытых 27 тысячах часов. Псевдоразметка зависит одновременно от оценщика впечатлений и языковой модели; тот же оценщик участвует в части объективной проверки. Реальные пары немногочисленны, поэтому перенос на другие языки, свободные указания и незнакомые виды выразительности не показан.
Фишка из статьи. Реальные и синтетические пары дают противоположный обмен между выразительностью и сохранением личности голоса.
| Обучающие пары | Сходство, знакомые | Следование, знакомые | Сходство, новые | Следование, новые |
|---|---|---|---|---|
| Реальные + псевдо | 3,35 | 3,22 | 3,22 | 3,32 |
| Только реальные | 2,67 | 3,50 | 2,63 | 3,48 |
| Только псевдо | 3,54 | 3,08 | 3,24 | 3,18 |
Как это читать: профессиональные записи учат сильнее менять манеру, но вместе с ней сдвигают и голосовую личность. Псевдоданные консервативнее; смешанное обучение не побеждает в каждом столбце, зато даёт более ровный рабочий режим.