TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue
TurnBench измеряет то, что обычно теряется за единственным показателем задержки голосового помощника: когда система считает реплику законченной, когда допускает перебивание и сколько ложных срабатываний платит за скорость. На 30 часах разговоров из шести областей ни одна из 14 систем не оказывается одновременно быстрой, чувствительной и избирательной.
Метод. События конца реплики и перебивания размечены тремя специалистами; 85,8% событий проходят согласование большинством. Межэкспертное κ составляет 0,77–0,80, а F1 границы события в окне ±200 мс — 0,94–0,96. Для каждого решения отдельно считают полноту, частоту ложных срабатываний и медианную задержку. К 30-часовой проверке приложен 104-часовой обучающий набор.
Результаты. Простой порог по энергии обнаруживает конец реплики с полнотой 0,718 и даже на 117 мс раньше границы, но ошибочно срабатывает в 63,2% отрицательных случаев. VAP снижает ложные срабатывания до 5,5% при полноте 0,845, однако запаздывает на 368 мс. Gemini Live еще осторожнее — 2,2% ложных решений, но медианная задержка достигает 1234 мс. Для перебиваний VAP дает полноту 0,945 при 10,7% ложных срабатываний и задержке 994 мс. Люди начинают плавную передачу хода в медиане за 151 мс до окончания текущей реплики.
Ограничения. Набор англоязычный, студийный и ограничен диалогом двух людей. Согласование большинством удаляет именно неоднозначные случаи, которые могут быть самыми ценными для живого общения. Авторы также не оценивают полную цепочку синтеза ответа и не предлагают единой методики для полноценных двусторонних систем, способных слушать во время собственной речи.
Фишка из статьи. Таблица конца реплики показывает не рейтинг, а фронт компромисса. Почти нулевую задержку можно получить порогом энергии, а малое число ложных ответов — осторожной семантической моделью, но совместить эти свойства пока не удалось.
| Система | Полнота конца реплики | Ложные срабатывания | Медианная задержка |
|---|---|---|---|
| Порог RMS | 0,718 | 0,632 | -117 мс |
| OpenAI Server VAD | 0,955 | 0,525 | 282 мс |
| VAP | 0,845 | 0,055 | 368 мс |
| Gemini Live | 0,657 | 0,022 | 1234 мс |
| Moshi | 0,233 | 0,044 | 702 мс |
Как это читать: отрицательная задержка RMS выглядит привлекательной только до учета 63,2% ложных решений. У Gemini противоположная крайность: система редко перебивает ошибочно, но пауза больше секунды уже воспринимается как нарушение темпа разговора.