Диалоговая речь Синтез речи Перекрытие реплик
arXiv cs.CL

DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

arXiv:2608.16053

Синтетические диалоги обычно собирают из готовых реплик, а паузы, перебивания и короткие подтверждения расставляют правилами. DuplexGen оставляет текст заранее заданным, но передаёт момент вступления двум полнодуплексным речевым моделям, которые слушают друг друга в реальном времени. Затем дешёвую по качеству «репетицию» перерисовывает хороший синтезатор, сохраняя найденный рисунок взаимодействия.

Метод. Языковая модель сначала пишет сценарий и порядок говорящих. Два экземпляра Moshi при каждом кадре могут произнести только следующий знак сценария, промолчать или выдать разрешённую короткую реплику слушателя; поэтому содержание не меняется, а время возникает из совместного исполнения. Три параметра ограничивают окно передачи хода, максимальную паузу и частоту подтверждений. Символьная партитура фиксирует начало реплик, перекрытия и перебивания, после чего CosyVoice пересинтезирует голоса и переносит относительные позиции событий, а также сразу выдаёт временные метки и RTTM.

Результаты. На 5611 переходах в клинических диалогах расстояние Вассерштейна между реальным и синтетическим распределением пауз/перекрытий снижается до 0,366 против 0,695 у склейки со случайной паузой и 0,783 у фиксированной. Статистика KS равна 0,197 против 0,432 и 0,557. Доля переходов с перекрытием достигает 38,5% при 42,8% в реальных данных, тогда как обе склейки дают 0%. Принудительный WER сценария равен 0%, после качественного пересинтеза не превышает 1,7%, а сходство голоса CAM++ составляет 0,82.

Ограничения. Возникает только локальное время, а общую плотность событий всё равно задают три ручных регулятора. Глубокие перебивания внутри реплики не моделируются, и участники не могут изменить содержание в ответ на услышанное. Реальное распределение взято из одного клинического корпуса, клиническая достоверность синтетических разговоров не заявлена. Самое важное: ошибки распознавания сильнее зависят от громкости и способа смешивания перекрывающихся голосов, чем от того, возникло ли время интерактивно.

Фишка из статьи. Контролируемый опыт 2x2 отделяет очередность реплик от акустики смешивания и даёт редкий отрицательный вывод: «естественное» время само по себе почти не делает распознавание труднее.

Время репликСмешиваниеWER на перекрытии
Возникшее во взаимодействииОбрезка + затухание18,8% (13,1-24,6)
Заданное склейкойОбрезка + затухание23,2% (15,5-31,8)
Возникшее во взаимодействииРавная громкость44,1% (37,5-49,6)
Заданное склейкойРавная громкость43,3% (36,9-50,0)
Реальный диалогЕстественная акустика76,5% (56,4-99,6)

Как это читать: доверительные интервалы строк с одинаковым способом смешивания почти совпадают. Переход к равной громкости примерно удваивает ошибку, но даже он заметно проще реальной речи, поэтому реалистичная акустика перекрытия остаётся более крупной проблемой, чем генерация временной структуры.

Оригинальная статья на arXiv