TurnFSM for Full-Duplex Dialogue System: Internalizing State-Machine Logic for Streaming Semantic Voice Activity Detection and Utterance-Level Rejection
TurnFSM встраивает конечный автомат непосредственно в речевую модель, чтобы она различала слушание, отправку реплики, принятие и отклонение пользовательского высказывания. Это снимает часть конфликтов между отдельными VAD, распознавателем и логикой диалога, особенно при перебивках и незавершённых командах.
Метод. Состояния выдаются специальными токенами, а маски внимания и позиции ограничивают переходы первым порядком: следующее решение зависит от текущего состояния и доступного звука. Обучение использует 11 200 часов выравнивания, внутренние данные смыслового VAD и около 700 тыс. примеров отклонения высказываний.
Результаты. Полная модель достигает успешности 82,41%, частоты ошибочного продолжения 12,06% и тайм-аута 5,53%. Медианная задержка для успешных случаев равна 80,9 мс, для всех — 222,7 мс; FAR 3,35%, FRR 16,04%. Отдельная двоичная голова даёт 80,29% успеха и 119 мс задержки успешных решений. На внешнем EasyTurn точность 91% против 97% у специализированной модели.
Ограничения. Основные данные и сценарии внутренние, а объёмы разных подзадач сильно различаются. Работа не приводит стоимость вычислений и не отделяет выигрыш автомата от большого набора разметки. Внешняя точность уступает специализированной системе.
Фишка из статьи. Ограничение переходов первым порядком уменьшает не только логические ошибки, но и хвост задержки.
| Вариант | Успех, % | Ошибочное продолжение, % | Задержка успеха, мс |
|---|---|---|---|
| TurnFSM | 82,41 | 12,06 | 80,9 |
| Без переходов первого порядка | 81,97 | 13,32 | 111,35 |
| Без выравнивания | 79,39 | 15,83 | 78,3 |
| Отдельная двоичная голова | 80,29 | 12,06 | 119,0 |
Как это читать: явная структура автомата даёт умеренный прирост успеха, но заметно ускоряет правильное решение. Выравнивание сильнее влияет на ошибки, чем на медианную задержку.