Turn-taking Evaluation Dialogue
Spoken dialogue eval

TurnNat: automatic score для natural turn-taking в spoken dialogue

88.0% pair acc

TurnNat интересна тем, что переносит оценку spoken dialogue из зоны “насколько хорошо звучит ответ” в более тонкую зону timing: естественно ли система входит в реплику, держит паузу, дает backchannel и не перебивает собеседника. Главный ход статьи — не собирать новую MOS-метрику, а обучить каузальную модель предсказывать turn-taking по VAD-boundary units и использовать likelihood/NLL как автоматический score естественности.

Метод. Авторы кодируют диалог как последовательность дискретных событий активности двух участников: речь, пауза, overlap, переход хода. Модель обучается предсказывать следующий boundary unit в каузальном режиме, поэтому score можно считать локально по фрагменту без знания будущего. Для проверки они создают perturbation benchmark: задерживают ответ на 1.2–2.0 с, сдвигают ранний вход на 1.2–2.5 с, меняют hold/shift и добавляют лишние backchannels в 20–25-секундных клипах.

Результаты. На человеческой проверке 18 аннотаторов дали 450 judgments: естественная версия выбиралась в 68.0% случаев, majority agreement составил 0.780, а Krippendorff ordinal alpha — 0.341, то есть задача субъективная и не тривиальная даже для людей. Лучшая модель D4 DualTurn с 256-way categorization и auxiliary fine-tuning получает C-index 0.676 и pair accuracy 88.0%; по типам искажений она особенно уверенно ловит late response (95.0%) и early entry (92.5%).

Ограничения. Метрика оценивает turn-taking naturalness через VAD-паттерны, поэтому не видит семантику, prosody quality и прагматическую уместность реплики. Benchmark построен на искусственных perturbations, а не на реальных ошибках production voice agents; кроме того, agreement людей умеренный, так что score лучше воспринимать как диагностический сигнал, а не абсолютную “правду” о качестве диалога.

Фишка из статьи. Самый полезный кусок — разбор того, что модель научилась различать разные классы timing-ошибок, а не просто присваивать “плохим” клипам меньший likelihood.

ИскажениеКак сделано в benchmarkAccuracy лучшей TurnNat
Late responseзадержка ответа на 1.2–2.0 с95.0%
Early entryранний вход на 1.2–2.5 с92.5%
Hold → shiftмодель должна заметить неверную смену хода81.0%
Shift → holdсистема продолжает “держать” ход там, где нужен переход84.5%
Excess backchannelдобавлены лишние короткие реакции87.0%

Как это читать: TurnNat выглядит особенно практичной как regression test для voice agents. Если новая версия модели стала чаще задерживать ответы или перебивать, score должен падать не из-за текста ответа, а именно из-за нарушения динамики turn-taking.

Оригинальная статья на arXiv