X2-Turn: потоковое распознавание речи вместе с состоянием реплики
X2-Turn решает задачу, которая важна для голосовых агентов: понимать текст речи и одновременно решать, завершил ли пользователь реплику. Обычный каскад сначала распознает речь, затем отдельная модель определяет состояние turn-taking, что добавляет задержку и ошибки на границе фразы. Здесь авторы делают frame-synchronous модель с двумя головами, где текст и состояние реплики предсказываются в одной потоковой временной сетке.
Метод. Система использует 80-миллисекундную временную дискретизацию и две связанные головы: одна отвечает за потоковое распознавание речи, другая - за состояние реплики. Вместо внешнего VAD+ASR+LLM каскада модель получает задержку tau и принимает решение почти синхронно с акустическим потоком. Это удобно для real-time диалога: можно явно выбирать компромисс между ранним ответом и риском перебить пользователя.
Результаты. На китайском наборе X2-Turn дает accuracy 91.00/93.00/96.00 для complete/incomplete/backchannel при задержке 288 мс; потоковый SoulX дает 77.67/88.96 и задержку 295 мс. На английском X2-Turn получает 92.10/84.60 при задержке 225 мс, что лучше SoulX по двум основным состояниям. При уменьшении tau с 480 до 320 мс задержка падает с 288 до 120 мс для китайского и с 225 до 65 мс для английского, но средняя точность также снижается.
Ограничения. Совместное обучение ухудшает часть распознавания речи после дообучения на turn-state задачу, и авторы прямо оставляют баланс между двумя целями как будущую работу. Также не хватает проверки на более шумных, естественных разговорах с перебиваниями и неидеальными микрофонами. Отдельно нужно измерять поведение в продукте: низкая задержка не гарантирует хорошую субъективную очередность реплик.
Фишка из статьи. Самая практичная таблица - задержка против точности при разных tau. Она показывает, что параметр можно выбирать под продуктовый режим, а не считать единственно правильным.
| tau | Средняя точность ZH / EN | Задержка ZH / EN |
|---|---|---|
| 480 мс | 92.00 / 88.49 | 288 / 225 мс |
| 400 мс | 91.50 / 85.25 | 208 / 145 мс |
| 320 мс | 90.67 / 85.09 | 120 / 65 мс |
Как это читать: уменьшение tau почти вдвое снижает задержку, но цена по точности различается между языками. Для голосового помощника это настраиваемая ручка: лучше иметь чуть больше задержку в сложном домене, чем систематически перебивать пользователя.