Predicting Turn-Taking Outcomes in Multi-Party Conversation: Interpretable Modelling of Speech and Gaze Dynamics with Interpersonal Closeness
Работа предсказывает, закончится ли смена говорящего паузой или наложением реплик, используя только три секунды до границы хода. Главный вывод практичен: кратковременная громкость остаётся сильнейшим признаком удержания слова, но движение взгляда даёт небольшой и устойчивый прирост даже в шуме.
Метод. В четырёхсторонних беседах GaMMA взгляд кодируется семью состояниями; из переходов извлекаются биграммы, энтропия, адресация, взаимный взгляд, а также компоненты PCA и NMF. К ним добавляются 200–600-миллисекундные окна громкости текущего говорящего в фонах и статическая оценка близости собеседников. Логистическая регрессия с elastic net проверяется по 15 внешним разбиениям: с исключением группы и акустического условия.
Результаты. Модель только по взгляду получает ROC AUC 0,58±0,05 и PR AUC 0,60±0,06; совместная модель — 0,76±0,04 и 0,77±0,05. Добавление взгляда поверх громкости повышает ROC AUC на 0,03 и PR AUC на 0,08, во всех разбиениях p<0,001. По четырём условиям, от тишины до меняющегося шума, совместный ROC AUC остаётся в диапазоне 0,74–0,77.
Ограничения. Данные состоят из 11 однородных групп носителей языка в контролируемой обстановке. Ручные признаки и фиксированное трёхсекундное окно не описывают непрерывную динамику, жесты, поворот головы и содержание реплики; временное разрешение взгляда и звука ограничено. Близость собеседников постоянна для пары, её взаимодействие с поведением не исследовано.
Фишка из статьи. На пороге максимального F1 модель по взгляду достигает полноты 1,00, но почти не отбрасывает ложные перекрытия. Громкость снижает полноту до 0,80, зато заметно повышает точность и общую правильность; взгляд затем улучшает ранжирование поверх неё.
| Вход | ROC AUC | PR AUC | Точность класса | Полнота | F1 | Правильность |
|---|---|---|---|---|---|---|
| Только взгляд | 0,58 | 0,60 | 0,50 | 1,00 | 0,66 | 0,58 |
| Взгляд + громкость | 0,76 | 0,77 | 0,62 | 0,80 | 0,69 | 0,71 |
Как это читать: небольшая разница F1 скрывает большой сдвиг в полезности предсказаний. Совместная модель реже объявляет перекрытие без оснований, а AUC показывает, что она существенно лучше упорядочивает события по риску конкурентного входа.