распознавание речи скрытые состояния именные сущности
arXiv cs.CL

Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions

arXiv:2609.02940

Авторы ускоряют точное распознавание речи не новым декодером, а выборочным включением дорогого лучевого поиска только там, где скрытые состояния звуковой языковой модели указывают на риск ошибки. Особенно хорошо такой сигнал работает для имён и редких сущностей, где жадное декодирование обычно экономно, но хрупко.

Метод. Phi-4 Multimodal дообучают через LoRA, а признаки взаимодействия звуковых и текстовых скрытых состояний подают в лёгкий селектор. Около 10% токенов обрабатываются лучом ширины 5, остальные остаются жадными. Дополнительный языковой проход исправляет кандидатов, не требуя полного лучевого поиска для всей фразы.

Результаты. Средний WER снижается с 6,57% при жадном выводе до 6,51%, тогда как полный луч даёт 6,36%. Зато ошибка по именованным сущностям падает с 19,55% до 18,38%, почти достигая 18,29% полного луча. Вычислительная стоимость составляет 1,4 условной единицы против 5 у полного поиска; авторы оценивают восстановление 96,4% его выигрыша на сущностях.

Ограничения. Опыты проведены на одной крупной модели и зависят от её внутренних состояний, поэтому переносимость селектора не показана. Среднее улучшение WER невелико, а стоимость обучения самого распознавателя и дополнительного языкового исправления в сравнении не раскрыта полностью.

Фишка из статьи. Абляция отделяет пользу выбора сложных мест от пользы последующего языкового исправления.

ВариантСредний WER, %Ошибка сущностей, %Восстановленный выигрыш луча
Жадный вывод6,5719,550%
Выборочный луч без исправления LLM6,5118,6968,3%
Полный метод6,5118,3896,4%
Полный луч6,3618,29100%

Как это читать: обычный WER почти не различает два выборочных варианта, но проверка имён показывает, что примерно треть полезного эффекта возникает именно на этапе языкового самоисправления.

Оригинальная статья на arXiv