дублирование речи полнодуплексный диалог синтез речи
arXiv cs.CL

Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis

arXiv:2609.03992

Text-Audiobox синтезирует перевод и реплики диалога без внешнего временного выравнивания текста с исходной записью. Вместо заранее размеченных границ 3-миллиардная модель сама связывает текст, голос, просодию и длительность в непрерывном пространстве DAC-VAE, что особенно полезно для перебивок и естественных пауз.

Метод. Диффузионно-поточная модель получает текст, звуковой контекст и указание режима: дубляж либо полнодуплексный ответ. Предварительное обучение дополняется одноязычным и межъязыковым обучением с учителем. При выводе до 32 кандидатов можно повторно ранжировать по распознаваемости и сходству голоса.

Результаты. Масштабирование с 300 млн до 3 млрд параметров снижает WER с 44,45% до 13,98% и повышает сходство голоса с 0,64 до 0,76. После специализированного обучения WER доходит до 2,72%, но сходство падает до 0,60 при добавлении межъязыковых данных. Среди человеческих парных оценок наиболее заметны предпочтения по естественности, +0,39–0,45, и пригодности к публикации, +0,38–0,40, относительно внутренней основы.

Ограничения. Основные сравнения проведены с внутренними системами, а генерация и повторное ранжирование 32 кандидатов дороги. На длинном диалоге сходство с человеческой речью падает до 3,86 против 4,53 на коротком. Внешнее выравнивание удалено, но контроль точных временных границ от этого становится менее предсказуемым.

Фишка из статьи. Межъязыковые данные улучшают слова и естественность, но заметно размывают голос говорящего; повторное ранжирование частично возвращает оба свойства ценой большого числа генераций.

ЭтапWER, %Сходство голосаЭстетическая оценка
Предварительное обучение5,930,696,72
Одноязычное обучение3,160,736,75
+ межъязычные данные2,720,606,82
32 кандидата, повторное ранжирование2,200,74не указана

Как это читать: лучший WER до повторного отбора получен ценой потери идентичности голоса. Итоговая строка выглядит сильнее, но требует сгенерировать 32 версии, поэтому это скорее верхняя граница качества, чем обычный режим.

Оригинальная статья на arXiv