синтез речи управление голосом псевдоразметка
arXiv cs.SD

Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction

arXiv:2609.02623

Работа учит японский синтез речи выполнять словесные указания вроде «мягче» или «энергичнее», не требуя для каждого указания пары профессионально записанных голосов. Главный ход — построить сотни тысяч псевдотроек «исходный голос — указание — изменённый голос» через пространство из 13 впечатлений о голосе, а затем обучить небольшой преобразователь вложений на основе rectified flow, не меняя основную систему синтеза.

Метод. Управляемый синтезатор создаёт модифицированную речь из 13-мерного вектора впечатлений, а Qwen формулирует направление изменения. Так собрано 350 617 псевдотроек от 1600 говорящих, 127,6 часа уникальной речи; отдельный реальный набор содержит 6899 пар профессиональных актёров. Исправитель стиля обучается методом rectified flow в пространстве голосовых вложений, после чего замороженный синтезатор произносит новый текст.

Результаты. На незнакомых говорящих полная смесь данных получает UTMOS 2,97 и оценку следования указанию 3,24. Только реальные пары лучше следуют направлению по субъективной оценке, 3,48 против 3,32 у полной системы, но хуже сохраняют сходство с исходным голосом: 2,63 против 3,22. Только псевдоданные дают сходство 3,24 и следование 3,18. В прослушивании участвовали 258 и 208 оценщиков, не менее десяти на пример.

Ограничения. Все данные японские, а основная модель обучена на закрытых 27 тысячах часов. Псевдоразметка зависит одновременно от оценщика впечатлений и языковой модели; тот же оценщик участвует в части объективной проверки. Реальные пары немногочисленны, поэтому перенос на другие языки, свободные указания и незнакомые виды выразительности не показан.

Фишка из статьи. Реальные и синтетические пары дают противоположный обмен между выразительностью и сохранением личности голоса.

Обучающие парыСходство, знакомыеСледование, знакомыеСходство, новыеСледование, новые
Реальные + псевдо3,353,223,223,32
Только реальные2,673,502,633,48
Только псевдо3,543,083,243,18

Как это читать: профессиональные записи учат сильнее менять манеру, но вместе с ней сдвигают и голосовую личность. Псевдоданные консервативнее; смешанное обучение не побеждает в каждом столбце, зато даёт более ровный рабочий режим.

Оригинальная статья на arXiv