Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis
Text-Audiobox синтезирует перевод и реплики диалога без внешнего временного выравнивания текста с исходной записью. Вместо заранее размеченных границ 3-миллиардная модель сама связывает текст, голос, просодию и длительность в непрерывном пространстве DAC-VAE, что особенно полезно для перебивок и естественных пауз.
Метод. Диффузионно-поточная модель получает текст, звуковой контекст и указание режима: дубляж либо полнодуплексный ответ. Предварительное обучение дополняется одноязычным и межъязыковым обучением с учителем. При выводе до 32 кандидатов можно повторно ранжировать по распознаваемости и сходству голоса.
Результаты. Масштабирование с 300 млн до 3 млрд параметров снижает WER с 44,45% до 13,98% и повышает сходство голоса с 0,64 до 0,76. После специализированного обучения WER доходит до 2,72%, но сходство падает до 0,60 при добавлении межъязыковых данных. Среди человеческих парных оценок наиболее заметны предпочтения по естественности, +0,39–0,45, и пригодности к публикации, +0,38–0,40, относительно внутренней основы.
Ограничения. Основные сравнения проведены с внутренними системами, а генерация и повторное ранжирование 32 кандидатов дороги. На длинном диалоге сходство с человеческой речью падает до 3,86 против 4,53 на коротком. Внешнее выравнивание удалено, но контроль точных временных границ от этого становится менее предсказуемым.
Фишка из статьи. Межъязыковые данные улучшают слова и естественность, но заметно размывают голос говорящего; повторное ранжирование частично возвращает оба свойства ценой большого числа генераций.
| Этап | WER, % | Сходство голоса | Эстетическая оценка |
|---|---|---|---|
| Предварительное обучение | 5,93 | 0,69 | 6,72 |
| Одноязычное обучение | 3,16 | 0,73 | 6,75 |
| + межъязычные данные | 2,72 | 0,60 | 6,82 |
| 32 кандидата, повторное ранжирование | 2,20 | 0,74 | не указана |
Как это читать: лучший WER до повторного отбора получен ценой потери идентичности голоса. Итоговая строка выглядит сильнее, но требует сгенерировать 32 версии, поэтому это скорее верхняя граница качества, чем обычный режим.