потоковое распознавание речи задержка внимание
arXiv eess.AS

Избирательный просмотр вперёд для потокового распознавания речи с вниманием

arXiv:2609.37611

Вместо одинакового ожидания будущего звука для каждого слова система откладывает только неуверенные решения. Ограниченный кодировщик не позволяет контексту разрастаться с числом слоёв, а токенный триггер повторно кодирует и распознаёт проблемный фрагмент после прихода следующего блока.

Метод. Каждый блок хранится в нескольких возрастных версиях с нулевым, одним или несколькими будущими блоками. Малый классификатор по семи признакам уверенности решает, фиксировать токен или ждать; бюджет ожидания ограничивает тяжёлый хвост задержки.

Результаты. На LibriSpeech test-clean динамический режим достигает WER 6,5% при медианной задержке 306 мс, тогда как статический один будущий блок даёт 6,7% и 860 мс, а четыре блока 6,5% и 2910 мс. Декодирование остаётся быстрее реального времени: RTF 0,60 при ожидании 34% слов.

Ограничения. Хвост задержки без бюджета тяжёлый: 90-й процентиль достигает 2800 мс. На Common Voice дополнительное ожидание не помогает и немного ухудшает WER с 37,5 до 38,3%; метод не исправляет ошибки, вызванные сдвигом предметной области.

Фишка из статьи. Ограничение ожидания одним блоком резко сокращает хвост, но стоит всего 0,3 пункта WER. Случайное ожидание той же доли слов даёт одновременно худшую ошибку и задержку, то есть важно не количество отложенных решений, а их выбор.

РежимWER ↓Средняя задержкаМедиана90-й процентиль
Статический, 1 блок6,7%813 мс860 мс1298 мс
Динамический6,5%630 мс306 мс2800 мс
Динамический, бюджет 16,8%362 мс328 мс964 мс
Случайный триггер7,0%1410 мс1078 мс3248 мс

Как это читать: минимальная медиана не гарантирует приемлемый хвост. Для практической системы вариант с бюджетом выглядит устойчивее, хотя средний WER чуть хуже статического ориентира.

Оригинальная статья на arXiv