DuplexPO: RL для conversational dynamics в full-duplex spoken models
DuplexPO интересна тем, что отделяет в full-duplex spoken dialogue два разных умения: что сказать и когда вступать, замолкать или давать backchannel. Авторы утверждают, что ухудшение reasoning у более интерактивных голосовых агентов не является неизбежным: temporal policy можно доучивать отдельно на коротких dynamics-critical windows. Главный ход - RL не для содержания ответа, а для floor-control решений во времени.
Метод. Система берет instruction-tuned spoken model и выделяет из длинных human dialogues окна, где важны turn initiation, backchanneling, yielding после barge-in и подавление нежелательных паттернов. Reward Factorized Conversational Dynamics Reward (FCDR) считает отдельные компоненты для начала реплики, коротких backchannels, остановки после вмешательства пользователя и regularization. Оптимизация идет GRPO-style: для каждого окна sampled continuations образуют группу, rewards нормализуются внутри группы, а policy loss применяется к токенам внутри временного окна с KL penalty к reference policy.
Результаты. На Fisher DuplexPO снижает Onset MAE до 0.69 s против 0.98 у SFT baseline, повышает turn-taking yield rate с 92.1% до 98.7% и backchannel yield rate с 57.1% до 100.0%. На Seamless Onset MAE 1.03 s против 1.22, turn-taking init 98.0% против 91.8%, turn-taking yield 93.6% против 78.5%. На FDB-v3 модель получает 100.0% turn-take, latency 0.24 s и yield 100.0%; для сравнения, Moshi имеет latency 0.44 s и yield 71.9%. В intelligence evaluation DuplexPO не проседает: например Llama Questions 75.3 против 72.0 у SFT baseline, CommonEval 3.74 против 3.48, MMSU 56.2 против 54.9.
Ограничения. Метрики сильно завязаны на выбранные event definitions и window sampling; это хорошая лабораторная оценка timing policy, но не замена user study по естественности диалога. Reward может переобучиться на конкретные разметки Fisher/Seamless/FDB-v3, а latency в статье относится к их evaluation setup и не полностью описывает production pipeline с ASR/TTS/network stack. Кроме того, safety и interruption etiquette остаются вне основной оценки.
Фишка из статьи. Абляция показывает, что важен не только RL как таковой, а именно FCDR и group-normalized GRPO. Более грубая reward model и DPO-style pairwise objective хуже восстанавливают yielding и backchannel behavior.
| Dataset | Настройка | Onset MAE | Turn yield | Backchannel yield | Barge-in yield |
|---|---|---|---|---|---|
| Fisher | SFT baseline | 1.22 s | 78.5% | 79.4% | - |
| Fisher | FCDR reward | 0.69 s | 98.7% | 100.0% | - |
| Seamless | NRM reward | 1.32 s | 67.6% | 74.0% | - |
| Seamless | FCDR reward | 1.03 s | 93.6% | 93.3% | - |
| FDB-v3 | DPO objective | - | - | - | 93.3% |
| FDB-v3 | GRPO objective | - | - | - | 100.0% |
Как это читать: главный выигрыш не в том, что модель чаще говорит, а в том, что она лучше отпускает floor. Для real-time spoken agents это критично: ошибка yielding воспринимается как перебивание, даже если текст ответа качественный.