Речь Full-duplex Turn-taking
Диалоговые системы

Instruct-FD: проверка очередности в full-duplex диалогах

IAS 64.4%

Instruct-FD ставит простой, но важный вопрос: может ли full-duplex речевая система менять поведение очередности по инструкции. В реальном продукте один агент должен иногда слушать молча, иногда коротко подтверждать, иногда перебивать, а иногда продолжать говорить сквозь пользовательское "угу". Авторы делают benchmark, где проверяется не качество ответа вообще, а подчинение политике turn-taking в одном и том же разговорном контексте.

Метод. Датасет построен из 912 тестов на 29 сценариях с пятью типами инструкций: Backchannel, Interrupt, Listen, Continue и Acknowledge. Важная деталь - один и тот же разговор используется с разными инструкциями, поэтому модель нельзя похвалить просто за удачный текст. Для оценки запускается multi-turn user orchestrator со stereo WAV-записью: один канал пользователь, другой модель; затем LLM-judge проверяет, выполнила ли система требуемое действие вовремя.

Результаты. Лучший общий результат у Gemini - IAS 64.4%, затем PersonaPlex 47.0% и Fun-Audio-Chat 46.2%. Но распределение крайне неровное: Continue часто высокий, до 97.5% у MiniCPM-o, а Interrupt у всех моделей остается в диапазоне 1.7-11.7%. LLM-judge проверили на 180 ручных аннотациях: accuracy 88.9%, macro-F1 87.6%; человеческая валидация сценариев дала 89.6% case accuracy.

Ограничения. Бенчмарк синтетически собран и англоязычный, поэтому он не заменяет живые разговоры с шумом, разными культурами очередности и неидеальным распознаванием речи. IAS зависит от качества судьи и расшифровки, а сами open-модели запускались на 8xH100, что не описывает продуктовую стоимость. Тем не менее протокол хорошо вскрывает timing failures, которые обычная текстовая оценка пропускает.

Фишка из статьи. Самый важный результат - модели выглядят вежливыми, но не управляемыми. Они часто умеют продолжать речь, зато почти не умеют вовремя перебивать и backchannel по инструкции.

МодельOverall IASListenBackchannelInterruptContinueAcknowledge
Gemini64.4%72.4%50.0%5.8%71.7%86.3%
Fun-Audio-Chat46.2%90.7%0.0%9.2%94.2%5.4%
MiniCPM-o36.4%59.6%12.5%1.7%97.5%5.4%
Moshi21.1%12.8%1.7%11.7%88.3%12.0%

Как это читать: высокий Continue не означает хороший full-duplex контроль. Наиболее продуктовые действия - коротко подтвердить во время речи пользователя или перебить по важному триггеру - остаются слабыми даже у сильных моделей.

Оригинальная статья на arXiv