полнодуплексный диалог активность речи потоковая обработка
arXiv eess.AS

TurnFSM for Full-Duplex Dialogue System: Internalizing State-Machine Logic for Streaming Semantic Voice Activity Detection and Utterance-Level Rejection

arXiv:2609.04240

TurnFSM встраивает конечный автомат непосредственно в речевую модель, чтобы она различала слушание, отправку реплики, принятие и отклонение пользовательского высказывания. Это снимает часть конфликтов между отдельными VAD, распознавателем и логикой диалога, особенно при перебивках и незавершённых командах.

Метод. Состояния выдаются специальными токенами, а маски внимания и позиции ограничивают переходы первым порядком: следующее решение зависит от текущего состояния и доступного звука. Обучение использует 11 200 часов выравнивания, внутренние данные смыслового VAD и около 700 тыс. примеров отклонения высказываний.

Результаты. Полная модель достигает успешности 82,41%, частоты ошибочного продолжения 12,06% и тайм-аута 5,53%. Медианная задержка для успешных случаев равна 80,9 мс, для всех — 222,7 мс; FAR 3,35%, FRR 16,04%. Отдельная двоичная голова даёт 80,29% успеха и 119 мс задержки успешных решений. На внешнем EasyTurn точность 91% против 97% у специализированной модели.

Ограничения. Основные данные и сценарии внутренние, а объёмы разных подзадач сильно различаются. Работа не приводит стоимость вычислений и не отделяет выигрыш автомата от большого набора разметки. Внешняя точность уступает специализированной системе.

Фишка из статьи. Ограничение переходов первым порядком уменьшает не только логические ошибки, но и хвост задержки.

ВариантУспех, %Ошибочное продолжение, %Задержка успеха, мс
TurnFSM82,4112,0680,9
Без переходов первого порядка81,9713,32111,35
Без выравнивания79,3915,8378,3
Отдельная двоичная голова80,2912,06119,0

Как это читать: явная структура автомата даёт умеренный прирост успеха, но заметно ускоряет правильное решение. Выравнивание сильнее влияет на ошибки, чем на медианную задержку.

Оригинальная статья на arXiv