Потоковая речь Диалог Задержка
arXiv cs.CL

X2-Turn: потоковое распознавание речи вместе с состоянием реплики

arXiv:2608.10878

X2-Turn решает задачу, которая важна для голосовых агентов: понимать текст речи и одновременно решать, завершил ли пользователь реплику. Обычный каскад сначала распознает речь, затем отдельная модель определяет состояние turn-taking, что добавляет задержку и ошибки на границе фразы. Здесь авторы делают frame-synchronous модель с двумя головами, где текст и состояние реплики предсказываются в одной потоковой временной сетке.

Метод. Система использует 80-миллисекундную временную дискретизацию и две связанные головы: одна отвечает за потоковое распознавание речи, другая - за состояние реплики. Вместо внешнего VAD+ASR+LLM каскада модель получает задержку tau и принимает решение почти синхронно с акустическим потоком. Это удобно для real-time диалога: можно явно выбирать компромисс между ранним ответом и риском перебить пользователя.

Результаты. На китайском наборе X2-Turn дает accuracy 91.00/93.00/96.00 для complete/incomplete/backchannel при задержке 288 мс; потоковый SoulX дает 77.67/88.96 и задержку 295 мс. На английском X2-Turn получает 92.10/84.60 при задержке 225 мс, что лучше SoulX по двум основным состояниям. При уменьшении tau с 480 до 320 мс задержка падает с 288 до 120 мс для китайского и с 225 до 65 мс для английского, но средняя точность также снижается.

Ограничения. Совместное обучение ухудшает часть распознавания речи после дообучения на turn-state задачу, и авторы прямо оставляют баланс между двумя целями как будущую работу. Также не хватает проверки на более шумных, естественных разговорах с перебиваниями и неидеальными микрофонами. Отдельно нужно измерять поведение в продукте: низкая задержка не гарантирует хорошую субъективную очередность реплик.

Фишка из статьи. Самая практичная таблица - задержка против точности при разных tau. Она показывает, что параметр можно выбирать под продуктовый режим, а не считать единственно правильным.

tauСредняя точность ZH / ENЗадержка ZH / EN
480 мс92.00 / 88.49288 / 225 мс
400 мс91.50 / 85.25208 / 145 мс
320 мс90.67 / 85.09120 / 65 мс

Как это читать: уменьшение tau почти вдвое снижает задержку, но цена по точности различается между языками. Для голосового помощника это настраиваемая ручка: лучше иметь чуть больше задержку в сложном домене, чем систематически перебивать пользователя.

Оригинальная статья на arXiv