Факторизованное моделирование задержанных потоков для потокового распознавания речи на основе LLM
В Delayed Streams Modeling большая языковая модель на каждом звуковом кадре выбирает между ожиданием и словарным токеном, из-за чего специальные токены загрязняют языковое распределение и требуют дорогого softmax. F-DSM отделяет вероятность ожидания в маленькую голову, оставляя исходный словарь LLM для текста.
Метод. Отдельная бинарная голова сначала решает, выводить ли padding; только для непустого шага считается проекция на полный словарь. Специальный токен начала слова также удаляется. Система построена на потоковом Fast-Conformer и Qwen, обучена для японского CSJ и английского LibriSpeech при целевой задержке 160–800 мс.
Результаты. При задержке 480 мс средний CER CSJ снижается с 7,27% у DSM до 6,45%, а WER LibriSpeech — с 6,52% до 6,17%. На batch 32 память CSJ падает с 60,95 до 18,49 ГиБ, LibriSpeech — с 64,66 до 24,51 ГиБ; F-DSM единственный помещается при batch 64. RTF равен 0,811 и 0,759 против 0,827 и 0,780 у исходного DSM.
Ограничения. Ускорение вывода небольшое, потому что звуковой кодировщик и сама LLM всё равно считаются на каждом шаге. После адаптации текстовая перплексия остаётся намного хуже исходной Qwen, то есть факторизация лишь смягчает, но не устраняет забывание. Проверены две языковые выборки и жадное декодирование.
Фишка из статьи. Модель пропускает дорогой словарный softmax на большинстве кадров, но сквозной RTF улучшается лишь на несколько процентов. Главный выигрыш оказывается в памяти обучения и сохранении языкового распределения.
| Модель | Пропуск softmax, CSJ / LS | RTF, CSJ / LS | Память batch 32, CSJ / LS |
|---|---|---|---|
| DSM с токеном слова | — | 0,827 / 0,780 | 61,30 / 65,82 ГиБ |
| DSM без токена слова | — | 0,824 / 0,764 | 60,95 / 64,66 ГиБ |
| F-DSM | 74,70% / 66,89% | 0,811 / 0,759 | 18,49 / 24,51 ГиБ |
Как это читать: удаление большой проекции с двух третей шагов не удаляет основную вычислительную цепочку. Зато не нужно хранить огромные логиты ожидания для каждого кадра, поэтому память уменьшается в 2,6–3,3 раза и становятся доступны большие пакеты.