Распознавание речи Повторное ранжирование Языковые модели
arXiv eess.AS

Cached LLM Probability Retrieval for Speech Recognition

arXiv:2608.16023

Большая языковая модель хорошо различает правдоподобные гипотезы распознавания, но прямой пересчёт каждого N-best списка слишком дорог. Авторы заранее сохраняют вероятности следующего знака для контекстов из доменных текстов и во время распознавания заменяют вызов модели обычным поиском в кэше. Получается прозрачный слой повторного ранжирования без обучения параметров.

Метод. Учитель Qwen2.5-0.5B или Qwen3-8B вне рабочего контура вычисляет log p следующего знака для пар «контекст - продолжение». При промахе система последовательно сокращает контекст K, K/2, ..., 1 и, если ничего не найдено, использует нейтральное значение. Полностью локальный режим не вызывает учителя вообще; выборочный режим обращается к нему только для верхних гипотез при малой разнице между первым и вторым местом. Кэш-оценка нормируется и смешивается с оценкой распознавателя, а иногда и с обычной n-граммной моделью.

Результаты. На шести семействах распознавателей и нескольких языках лучший вариант кэша улучшает первый проход в 28 из 39 условий и делит лучший неоракульный результат в 25. Для Whisper-small улучшены все девять наборов, в среднем на 8,13 абсолютного пункта WER/CER. Особенно велики выигрыши на AMI IHM, шумном LibriSpeech и многоязычном FLEURS. Но для Whisper-large-v3 и части SpeechBrain результаты плоские или хуже: если N-best уже хорошо упорядочен либо не содержит правильной гипотезы, языковой кэш помочь не может.

Ограничения. Метод ограничен составом N-best списка и точным совпадением ключей; на AMI средняя доля попаданий в исходный кэш всего 0,61%. Статья не сообщает размер кэша, время его построения, задержку поиска и память, поэтому «лёгкость» пока подтверждена косвенно. Вес признака настраивается на отдельной выборке, а выборочный режим всё же требует работающей большой модели. Длинная семантическая зависимость при точном поиске почти не используется.

Фишка из статьи. Самый практичный отрицательный результат касается длины контекста: в 67 из 78 прогонов K=8 уже лучший или делит первое место, ни один прогон не предпочитает K>32, а максимальная разница между K=32 и более длинными вариантами равна всего 0,004 пункта ошибки.

Whisper-smallПервый проходЛучший кэшОракул N-bestМетрика
LibriSpeech test-other15,329,706,15WER, %
LibriSpeech, шум 5 дБ38,9530,0923,14WER, %
AMI IHM37,3924,3816,03WER, %
FLEURS, китайский34,0124,7916,61CER, %

Как это читать: кэш возвращает значительную часть доступного оракульного запаса без дообучения модели, но не закрывает его полностью. Короткие локальные контексты оказываются полезнее длинных редких ключей, поэтому бюджет памяти разумнее тратить на покрытие, а не на длину.

Оригинальная статья на arXiv