полнодуплексный диалог обучение с подкреплением речевые модели
arXiv cs.SD

HiPLEX: иерархическая политика для полнодуплексных речевых языковых моделей

arXiv:2610.07727

HiPLEX разделяет в полнодуплексной речевой модели решения «когда говорить» и «что сказать», чтобы временная и смысловая награды не спорили внутри одной токенной политики. Это не новая базовая модель, а способ точнее назначать подкрепление уже обученным Moshi и PersonaPlex.

Метод. Управляющая политика на каждом 80-мс кадре выбирает паузу, окончание паузы или выдачу содержания; условная политика выбирает текстовый токен только в третьем случае. Событийно-причинные маски направляют штраф за задержку на ожидание перед ответом, не на сам ответ, а LLM-судья даёт отдельную смысловую награду содержанию.

Результаты. На Moshi HiPLEX снижает CANDOR takeover во время пауз с 0,454 у GRPO до 0,306, при backchannel с 0,309 до 0,127 и задержку после перебивания с 0,660 до 0,439 с; судейская оценка растёт с 3,942 до 4,083. По трём зернам эффект удержания повторяется. Расстояние до человеческого распределения частоты backchannel падает с 1,512 до 0,327.

Ограничения. Метрики Full-Duplex-Bench частично насыщены и иногда считают приветствие захватом канала; качество ответа условно оценивается только там, где ответ найден. Рецепт чувствителен к модели: скорость обучения Moshi приводит PersonaPlex почти к молчанию, и требуется перенастройка наград. Общий backbone всё равно связывает две политики.

Фишка из статьи. Разреженность обновления сама по себе не помогает. Случайная маска той же плотности почти выключает модель, тогда как событийно-причинная маска сохраняет стопроцентную реакцию после хода пользователя.

Назначение временного кредитаTakeover на паузеЗадержка после перебивания, сДоля ответов после хода
Плоский GRPO0,4540,6600,992
Все кадры0,2640,8740,958
Фиксированное окно0,4630,4650,933
Случайная маска0,0283,2770,067
Событийно-причинная маска0,3060,4391,000

Как это читать: низкий takeover может означать вежливость, а может означать молчание. Только совместный взгляд на захват канала, задержку и долю ответов показывает, что HiPLEX подавляет речь в нужных интервалах, не подавляя участие вообще.

Оригинальная статья на arXiv