Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions
Авторы ускоряют точное распознавание речи не новым декодером, а выборочным включением дорогого лучевого поиска только там, где скрытые состояния звуковой языковой модели указывают на риск ошибки. Особенно хорошо такой сигнал работает для имён и редких сущностей, где жадное декодирование обычно экономно, но хрупко.
Метод. Phi-4 Multimodal дообучают через LoRA, а признаки взаимодействия звуковых и текстовых скрытых состояний подают в лёгкий селектор. Около 10% токенов обрабатываются лучом ширины 5, остальные остаются жадными. Дополнительный языковой проход исправляет кандидатов, не требуя полного лучевого поиска для всей фразы.
Результаты. Средний WER снижается с 6,57% при жадном выводе до 6,51%, тогда как полный луч даёт 6,36%. Зато ошибка по именованным сущностям падает с 19,55% до 18,38%, почти достигая 18,29% полного луча. Вычислительная стоимость составляет 1,4 условной единицы против 5 у полного поиска; авторы оценивают восстановление 96,4% его выигрыша на сущностях.
Ограничения. Опыты проведены на одной крупной модели и зависят от её внутренних состояний, поэтому переносимость селектора не показана. Среднее улучшение WER невелико, а стоимость обучения самого распознавателя и дополнительного языкового исправления в сравнении не раскрыта полностью.
Фишка из статьи. Абляция отделяет пользу выбора сложных мест от пользы последующего языкового исправления.
| Вариант | Средний WER, % | Ошибка сущностей, % | Восстановленный выигрыш луча |
|---|---|---|---|
| Жадный вывод | 6,57 | 19,55 | 0% |
| Выборочный луч без исправления LLM | 6,51 | 18,69 | 68,3% |
| Полный метод | 6,51 | 18,38 | 96,4% |
| Полный луч | 6,36 | 18,29 | 100% |
Как это читать: обычный WER почти не различает два выборочных варианта, но проверка имён показывает, что примерно треть полезного эффекта возникает именно на этапе языкового самоисправления.