речевой диалог смена реплик оценка моделей
arXiv eess.AS

TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue

arXiv:2608.25218

TurnBench измеряет то, что обычно теряется за единственным показателем задержки голосового помощника: когда система считает реплику законченной, когда допускает перебивание и сколько ложных срабатываний платит за скорость. На 30 часах разговоров из шести областей ни одна из 14 систем не оказывается одновременно быстрой, чувствительной и избирательной.

Метод. События конца реплики и перебивания размечены тремя специалистами; 85,8% событий проходят согласование большинством. Межэкспертное κ составляет 0,77–0,80, а F1 границы события в окне ±200 мс — 0,94–0,96. Для каждого решения отдельно считают полноту, частоту ложных срабатываний и медианную задержку. К 30-часовой проверке приложен 104-часовой обучающий набор.

Результаты. Простой порог по энергии обнаруживает конец реплики с полнотой 0,718 и даже на 117 мс раньше границы, но ошибочно срабатывает в 63,2% отрицательных случаев. VAP снижает ложные срабатывания до 5,5% при полноте 0,845, однако запаздывает на 368 мс. Gemini Live еще осторожнее — 2,2% ложных решений, но медианная задержка достигает 1234 мс. Для перебиваний VAP дает полноту 0,945 при 10,7% ложных срабатываний и задержке 994 мс. Люди начинают плавную передачу хода в медиане за 151 мс до окончания текущей реплики.

Ограничения. Набор англоязычный, студийный и ограничен диалогом двух людей. Согласование большинством удаляет именно неоднозначные случаи, которые могут быть самыми ценными для живого общения. Авторы также не оценивают полную цепочку синтеза ответа и не предлагают единой методики для полноценных двусторонних систем, способных слушать во время собственной речи.

Фишка из статьи. Таблица конца реплики показывает не рейтинг, а фронт компромисса. Почти нулевую задержку можно получить порогом энергии, а малое число ложных ответов — осторожной семантической моделью, но совместить эти свойства пока не удалось.

СистемаПолнота конца репликиЛожные срабатыванияМедианная задержка
Порог RMS0,7180,632-117 мс
OpenAI Server VAD0,9550,525282 мс
VAP0,8450,055368 мс
Gemini Live0,6570,0221234 мс
Moshi0,2330,044702 мс

Как это читать: отрицательная задержка RMS выглядит привлекательной только до учета 63,2% ложных решений. У Gemini противоположная крайность: система редко перебивает ошибочно, но пауза больше секунды уже воспринимается как нарушение темпа разговора.

Оригинальная статья на arXiv