Instruct-FD: проверка очередности в full-duplex диалогах
Instruct-FD ставит простой, но важный вопрос: может ли full-duplex речевая система менять поведение очередности по инструкции. В реальном продукте один агент должен иногда слушать молча, иногда коротко подтверждать, иногда перебивать, а иногда продолжать говорить сквозь пользовательское "угу". Авторы делают benchmark, где проверяется не качество ответа вообще, а подчинение политике turn-taking в одном и том же разговорном контексте.
Метод. Датасет построен из 912 тестов на 29 сценариях с пятью типами инструкций: Backchannel, Interrupt, Listen, Continue и Acknowledge. Важная деталь - один и тот же разговор используется с разными инструкциями, поэтому модель нельзя похвалить просто за удачный текст. Для оценки запускается multi-turn user orchestrator со stereo WAV-записью: один канал пользователь, другой модель; затем LLM-judge проверяет, выполнила ли система требуемое действие вовремя.
Результаты. Лучший общий результат у Gemini - IAS 64.4%, затем PersonaPlex 47.0% и Fun-Audio-Chat 46.2%. Но распределение крайне неровное: Continue часто высокий, до 97.5% у MiniCPM-o, а Interrupt у всех моделей остается в диапазоне 1.7-11.7%. LLM-judge проверили на 180 ручных аннотациях: accuracy 88.9%, macro-F1 87.6%; человеческая валидация сценариев дала 89.6% case accuracy.
Ограничения. Бенчмарк синтетически собран и англоязычный, поэтому он не заменяет живые разговоры с шумом, разными культурами очередности и неидеальным распознаванием речи. IAS зависит от качества судьи и расшифровки, а сами open-модели запускались на 8xH100, что не описывает продуктовую стоимость. Тем не менее протокол хорошо вскрывает timing failures, которые обычная текстовая оценка пропускает.
Фишка из статьи. Самый важный результат - модели выглядят вежливыми, но не управляемыми. Они часто умеют продолжать речь, зато почти не умеют вовремя перебивать и backchannel по инструкции.
| Модель | Overall IAS | Listen | Backchannel | Interrupt | Continue | Acknowledge |
|---|---|---|---|---|---|---|
| Gemini | 64.4% | 72.4% | 50.0% | 5.8% | 71.7% | 86.3% |
| Fun-Audio-Chat | 46.2% | 90.7% | 0.0% | 9.2% | 94.2% | 5.4% |
| MiniCPM-o | 36.4% | 59.6% | 12.5% | 1.7% | 97.5% | 5.4% |
| Moshi | 21.1% | 12.8% | 1.7% | 11.7% | 88.3% | 12.0% |
Как это читать: высокий Continue не означает хороший full-duplex контроль. Наиболее продуктовые действия - коротко подтвердить во время речи пользователя или перебить по важному триггеру - остаются слабыми даже у сильных моделей.