DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech
Синтетические диалоги обычно собирают из готовых реплик, а паузы, перебивания и короткие подтверждения расставляют правилами. DuplexGen оставляет текст заранее заданным, но передаёт момент вступления двум полнодуплексным речевым моделям, которые слушают друг друга в реальном времени. Затем дешёвую по качеству «репетицию» перерисовывает хороший синтезатор, сохраняя найденный рисунок взаимодействия.
Метод. Языковая модель сначала пишет сценарий и порядок говорящих. Два экземпляра Moshi при каждом кадре могут произнести только следующий знак сценария, промолчать или выдать разрешённую короткую реплику слушателя; поэтому содержание не меняется, а время возникает из совместного исполнения. Три параметра ограничивают окно передачи хода, максимальную паузу и частоту подтверждений. Символьная партитура фиксирует начало реплик, перекрытия и перебивания, после чего CosyVoice пересинтезирует голоса и переносит относительные позиции событий, а также сразу выдаёт временные метки и RTTM.
Результаты. На 5611 переходах в клинических диалогах расстояние Вассерштейна между реальным и синтетическим распределением пауз/перекрытий снижается до 0,366 против 0,695 у склейки со случайной паузой и 0,783 у фиксированной. Статистика KS равна 0,197 против 0,432 и 0,557. Доля переходов с перекрытием достигает 38,5% при 42,8% в реальных данных, тогда как обе склейки дают 0%. Принудительный WER сценария равен 0%, после качественного пересинтеза не превышает 1,7%, а сходство голоса CAM++ составляет 0,82.
Ограничения. Возникает только локальное время, а общую плотность событий всё равно задают три ручных регулятора. Глубокие перебивания внутри реплики не моделируются, и участники не могут изменить содержание в ответ на услышанное. Реальное распределение взято из одного клинического корпуса, клиническая достоверность синтетических разговоров не заявлена. Самое важное: ошибки распознавания сильнее зависят от громкости и способа смешивания перекрывающихся голосов, чем от того, возникло ли время интерактивно.
Фишка из статьи. Контролируемый опыт 2x2 отделяет очередность реплик от акустики смешивания и даёт редкий отрицательный вывод: «естественное» время само по себе почти не делает распознавание труднее.
| Время реплик | Смешивание | WER на перекрытии |
|---|---|---|
| Возникшее во взаимодействии | Обрезка + затухание | 18,8% (13,1-24,6) |
| Заданное склейкой | Обрезка + затухание | 23,2% (15,5-31,8) |
| Возникшее во взаимодействии | Равная громкость | 44,1% (37,5-49,6) |
| Заданное склейкой | Равная громкость | 43,3% (36,9-50,0) |
| Реальный диалог | Естественная акустика | 76,5% (56,4-99,6) |
Как это читать: доверительные интервалы строк с одинаковым способом смешивания почти совпадают. Переход к равной громкости примерно удваивает ошибку, но даже он заметно проще реальной речи, поэтому реалистичная акустика перекрытия остаётся более крупной проблемой, чем генерация временной структуры.