Распознавание речи Редкие слова Context
arXiv eess.AS

Редкие слова в распознавании речи: biasing против speech LLM

arXiv:2608.05759

Статья сравнивает два способа заставить систему распознавания речи правильно писать новые или редкие слова: специализированное контекстное смещение в Whisper и подсказки для речевых языковых моделей. Постановка полезная, потому что в продуктах чаще всего страдают именно имена, термины и названия, а не средний WER по распространенным словам. Главный вывод осторожный: большие речевые модели иногда хорошо используют список слов, но хуже переносят шумные или перегруженные подсказки.

Метод. Авторы берут Whisper large-v2 и два метода контекстного смещения, затем сравнивают их с Qwen3-ASR, Qwen3-Omni и VibeVoice-ASR. Метрики разделены на BWER для слов из списка подсказки, UWER для остальных слов и общий WER. Проверка идет на Earnings-21, LibriSpeech test-clean/test-other и Yodas; дополнительно добавляются 250 отвлекающих слов, а список подсказок пробуют фильтровать отдельной моделью.

Результаты. Контекстное смещение снижает ошибку на целевых словах на 37-70% для одного метода и на 48-88% для другого, почти не трогая остальные слова. Без отвлекающих слов Qwen3-Omni особенно силен на LibriSpeech: на test-clean BWER 1.10%, а на test-other 3.57%. Но при 250 отвлекающих словах речевые языковые модели резко теряют точность: на Yodas BWER у Qwen3-Omni вырастает до 26.98%, у VibeVoice - до 27.92%, тогда как специализированный метод контекстного смещения удерживает 6.69%.

Ограничения. Результаты зависят от качества списка подсказок, порядка слов в подсказке и отличия между прочитанной и спонтанной речью. Фильтрация списка отдельной моделью добавляет вычисления и сама может ошибаться. Кроме того, сравнение не закрывает вопрос задержки и стоимости для потокового распознавания.

Фишка из статьи. Самый интересный отрицательный результат - чувствительность речевых языковых моделей к отвлекающим словам. Большая модель умеет использовать правильный список, но при длинном списке с лишними элементами начинает вставлять или ожидать не те слова.

Yodas, целевые словаБез отвлекающих слов: BWER+250 отвлекающих слов: BWER
Whisper + сильное контекстное смещение5.73%6.69%
Qwen3-Omni5.08%26.98%
VibeVoice-ASR4.17%27.92%

Как это читать: BWER считает ошибки только на словах из списка. Речевые языковые модели выигрывают, когда список чистый, но специализированное контекстное смещение оказывается устойчивее к реалистичной ситуации, где в подсказку попадает много лишних кандидатов.

Оригинальная статья на arXiv