Full-duplex RL Turn-taking
Spoken dialogue

DuplexPO: RL для conversational dynamics в full-duplex spoken models

Latency 0.24s

DuplexPO интересна тем, что отделяет в full-duplex spoken dialogue два разных умения: что сказать и когда вступать, замолкать или давать backchannel. Авторы утверждают, что ухудшение reasoning у более интерактивных голосовых агентов не является неизбежным: temporal policy можно доучивать отдельно на коротких dynamics-critical windows. Главный ход - RL не для содержания ответа, а для floor-control решений во времени.

Метод. Система берет instruction-tuned spoken model и выделяет из длинных human dialogues окна, где важны turn initiation, backchanneling, yielding после barge-in и подавление нежелательных паттернов. Reward Factorized Conversational Dynamics Reward (FCDR) считает отдельные компоненты для начала реплики, коротких backchannels, остановки после вмешательства пользователя и regularization. Оптимизация идет GRPO-style: для каждого окна sampled continuations образуют группу, rewards нормализуются внутри группы, а policy loss применяется к токенам внутри временного окна с KL penalty к reference policy.

Результаты. На Fisher DuplexPO снижает Onset MAE до 0.69 s против 0.98 у SFT baseline, повышает turn-taking yield rate с 92.1% до 98.7% и backchannel yield rate с 57.1% до 100.0%. На Seamless Onset MAE 1.03 s против 1.22, turn-taking init 98.0% против 91.8%, turn-taking yield 93.6% против 78.5%. На FDB-v3 модель получает 100.0% turn-take, latency 0.24 s и yield 100.0%; для сравнения, Moshi имеет latency 0.44 s и yield 71.9%. В intelligence evaluation DuplexPO не проседает: например Llama Questions 75.3 против 72.0 у SFT baseline, CommonEval 3.74 против 3.48, MMSU 56.2 против 54.9.

Ограничения. Метрики сильно завязаны на выбранные event definitions и window sampling; это хорошая лабораторная оценка timing policy, но не замена user study по естественности диалога. Reward может переобучиться на конкретные разметки Fisher/Seamless/FDB-v3, а latency в статье относится к их evaluation setup и не полностью описывает production pipeline с ASR/TTS/network stack. Кроме того, safety и interruption etiquette остаются вне основной оценки.

Фишка из статьи. Абляция показывает, что важен не только RL как таковой, а именно FCDR и group-normalized GRPO. Более грубая reward model и DPO-style pairwise objective хуже восстанавливают yielding и backchannel behavior.

DatasetНастройкаOnset MAETurn yieldBackchannel yieldBarge-in yield
FisherSFT baseline1.22 s78.5%79.4%-
FisherFCDR reward0.69 s98.7%100.0%-
SeamlessNRM reward1.32 s67.6%74.0%-
SeamlessFCDR reward1.03 s93.6%93.3%-
FDB-v3DPO objective---93.3%
FDB-v3GRPO objective---100.0%

Как это читать: главный выигрыш не в том, что модель чаще говорит, а в том, что она лучше отпускает floor. Для real-time spoken agents это критично: ошибка yielding воспринимается как перебивание, даже если текст ответа качественный.

Оригинальная статья на arXiv