Распознавание речи Шепот Устойчивость
arXiv eess.AS

Whisper-Aware LLM: распознавание шепотной речи без галлюцинаций

arXiv:2608.10836

Эта работа про устойчивое распознавание шепотной речи, где обычные речевые модели часто ошибаются из-за отсутствия нормальной фонации и слабых гармонических признаков. Авторы не просто дообучают модель на шепоте, а добавляют самообучение неопределенности и управление декодированием по уверенности. Главный ход - научить речевую языковую модель понимать, где вход акустически ненадежен, и снижать вероятность галлюцинаций на шуме.

Метод. Модель получает targeted quality-awareness задачи и Confidence-Fused Decoding. На уровне кадров attention модулируется оценкой уверенности, а на глобальном уровне добавляется инструкция о качестве входа. По сравнению с обычной донастройкой Whisper-подобной модели это меняет не только данные обучения, но и сам способ декодирования: неопределенность входит в генерацию текста.

Результаты. На английских наборах с обычной и шепотной речью модель получает WER 4.15/5.89/5.92/10.81 для NUS/NSG/WUS/WSG, обходя сильные baselines вроде Seed-ASR, у которого WER 4.29/6.51/6.88/12.95. На AISHELL6 по китайскому CER модель дает 0.63 на нормальной речи и 1.31 на шепоте; Seed-ASR на шепоте дает 1.58, Qwen3-ASR - 3.79, FunASR - 19.50. На наборе шума hallucination rate падает до 4.5% против 25-35% у сравниваемых моделей.

Ограничения. Статья всего на несколько страниц, поэтому не хватает подробного анализа ошибок, задержки и стоимости обучения. Проверка языков ограничена английским и китайским, а наборы шепота и шума выглядят специально подобранными под задачу. Нужно отдельно смотреть, как метод ведет себя на реальных микрофонах, тихой речи и смешанных режимах между шепотом и голосом.

Фишка из статьи. Хорошая абляция показывает, что основная прибавка приходит не от одной тонкой настройки, а от глобальной инструкции о качестве входа.

Вариант на AISHELL6-WhisperCERВывод
Обычная донастройка3.98базовый уровень для той же модели
+ модуляция attention3.45небольшое улучшение
+ глобальная инструкция1.84основной скачок качества
Полная система1.31лучший результат абляции

Как это читать: если модель знает, что вход шепотный или ненадежный, она меняет поведение сильнее, чем от локальной кадровой поправки. Это важно для антигаллюцинаций: проблема не только в акустике, но и в уверенности декодера.

Оригинальная статья на arXiv