потоковое распознавание речи LLM задержка
arXiv eess.AS

Факторизованное моделирование задержанных потоков для потокового распознавания речи на основе LLM

arXiv:2610.04333

В Delayed Streams Modeling большая языковая модель на каждом звуковом кадре выбирает между ожиданием и словарным токеном, из-за чего специальные токены загрязняют языковое распределение и требуют дорогого softmax. F-DSM отделяет вероятность ожидания в маленькую голову, оставляя исходный словарь LLM для текста.

Метод. Отдельная бинарная голова сначала решает, выводить ли padding; только для непустого шага считается проекция на полный словарь. Специальный токен начала слова также удаляется. Система построена на потоковом Fast-Conformer и Qwen, обучена для японского CSJ и английского LibriSpeech при целевой задержке 160–800 мс.

Результаты. При задержке 480 мс средний CER CSJ снижается с 7,27% у DSM до 6,45%, а WER LibriSpeech — с 6,52% до 6,17%. На batch 32 память CSJ падает с 60,95 до 18,49 ГиБ, LibriSpeech — с 64,66 до 24,51 ГиБ; F-DSM единственный помещается при batch 64. RTF равен 0,811 и 0,759 против 0,827 и 0,780 у исходного DSM.

Ограничения. Ускорение вывода небольшое, потому что звуковой кодировщик и сама LLM всё равно считаются на каждом шаге. После адаптации текстовая перплексия остаётся намного хуже исходной Qwen, то есть факторизация лишь смягчает, но не устраняет забывание. Проверены две языковые выборки и жадное декодирование.

Фишка из статьи. Модель пропускает дорогой словарный softmax на большинстве кадров, но сквозной RTF улучшается лишь на несколько процентов. Главный выигрыш оказывается в памяти обучения и сохранении языкового распределения.

МодельПропуск softmax, CSJ / LSRTF, CSJ / LSПамять batch 32, CSJ / LS
DSM с токеном слова—0,827 / 0,78061,30 / 65,82 ГиБ
DSM без токена слова—0,824 / 0,76460,95 / 64,66 ГиБ
F-DSM74,70% / 66,89%0,811 / 0,75918,49 / 24,51 ГиБ

Как это читать: удаление большой проекции с двух третей шагов не удаляет основную вычислительную цепочку. Зато не нужно хранить огромные логиты ожидания для каждого кадра, поэтому память уменьшается в 2,6–3,3 раза и становятся доступны большие пакеты.

Оригинальная статья на arXiv