Cached LLM Probability Retrieval for Speech Recognition
Большая языковая модель хорошо различает правдоподобные гипотезы распознавания, но прямой пересчёт каждого N-best списка слишком дорог. Авторы заранее сохраняют вероятности следующего знака для контекстов из доменных текстов и во время распознавания заменяют вызов модели обычным поиском в кэше. Получается прозрачный слой повторного ранжирования без обучения параметров.
Метод. Учитель Qwen2.5-0.5B или Qwen3-8B вне рабочего контура вычисляет log p следующего знака для пар «контекст - продолжение». При промахе система последовательно сокращает контекст K, K/2, ..., 1 и, если ничего не найдено, использует нейтральное значение. Полностью локальный режим не вызывает учителя вообще; выборочный режим обращается к нему только для верхних гипотез при малой разнице между первым и вторым местом. Кэш-оценка нормируется и смешивается с оценкой распознавателя, а иногда и с обычной n-граммной моделью.
Результаты. На шести семействах распознавателей и нескольких языках лучший вариант кэша улучшает первый проход в 28 из 39 условий и делит лучший неоракульный результат в 25. Для Whisper-small улучшены все девять наборов, в среднем на 8,13 абсолютного пункта WER/CER. Особенно велики выигрыши на AMI IHM, шумном LibriSpeech и многоязычном FLEURS. Но для Whisper-large-v3 и части SpeechBrain результаты плоские или хуже: если N-best уже хорошо упорядочен либо не содержит правильной гипотезы, языковой кэш помочь не может.
Ограничения. Метод ограничен составом N-best списка и точным совпадением ключей; на AMI средняя доля попаданий в исходный кэш всего 0,61%. Статья не сообщает размер кэша, время его построения, задержку поиска и память, поэтому «лёгкость» пока подтверждена косвенно. Вес признака настраивается на отдельной выборке, а выборочный режим всё же требует работающей большой модели. Длинная семантическая зависимость при точном поиске почти не используется.
Фишка из статьи. Самый практичный отрицательный результат касается длины контекста: в 67 из 78 прогонов K=8 уже лучший или делит первое место, ни один прогон не предпочитает K>32, а максимальная разница между K=32 и более длинными вариантами равна всего 0,004 пункта ошибки.
| Whisper-small | Первый проход | Лучший кэш | Оракул N-best | Метрика |
|---|---|---|---|---|
| LibriSpeech test-other | 15,32 | 9,70 | 6,15 | WER, % |
| LibriSpeech, шум 5 дБ | 38,95 | 30,09 | 23,14 | WER, % |
| AMI IHM | 37,39 | 24,38 | 16,03 | WER, % |
| FLEURS, китайский | 34,01 | 24,79 | 16,61 | CER, % |
Как это читать: кэш возвращает значительную часть доступного оракульного запаса без дообучения модели, но не закрывает его полностью. Короткие локальные контексты оказываются полезнее длинных редких ключей, поэтому бюджет памяти разумнее тратить на покрытие, а не на длину.