распознавание речи галлюцинации декодирование
arXiv eess.AS

Likelihood-Constrained Acoustic Reranking for Training-Free Hallucination Mitigation in LLM-Based ASR

arXiv:2608.30776

LCAR уменьшает галлюцинации больших моделей распознавания без обучения и внешнего детектора. Вместо свободной замены токена метод рассматривает только почти столь же вероятные продолжения, как жадное, и среди них предпочитает вариант, лучше согласованный со звуковым представлением.

Метод. На каждом шаге допускаются токены, чья логарифмическая вероятность отстаёт от лучшего не более чем на δ; EOS не переопределяется. Звуковая совместимость вычисляется из объединённых вниманием представлений аудио через уже имеющуюся выходную голову модели. При δ=0 алгоритм точно совпадает с жадным декодированием; основная настройка δ=0,60 допускает кандидата с вероятностью не ниже 54,9% от вероятности лидера.

Результаты. Испытаны Qwen3-ASR-1.7B, Qwen2-Audio-7B Base, Kimi-Audio-7B и GLM-ASR-Nano на двух вручную проверенных стресс-наборах по 500 записей. При δ=0,60 средний набор содержит лишь 1,076 кандидата, меняется 4,0% токенов, а обычный WER/CER сдвигается от −0,154 до +0,129 пункта в зависимости от модели. Чистое исправление галлюцинаций положительно во всех системах: 5,7–43,7 пункта на синтетической речи и 52,8–70,9 на OpenSpeech. Из 3997 обнаруженных событий 28,8% заканчиваются точным восстановлением, а 52% превращаются в обычную ошибку распознавания.

Ограничения. Наборы специально обогащены галлюцинациями и не оценивают их распространённость в обычном потоке. Проверены главным образом китайско-английские модели, потоковый вывод не исследован, а реализация требует доступа к внутренним состояниям и вниманию. Детектор событий строился с участием Qwen3-32B и ручной проверки; устранение галлюцинации не гарантирует точную расшифровку.

Фишка из статьи. Абляция показывает, зачем нужно ограничение правдоподобия. Если выбирать токен только по звуковой совместимости, WER и CER взрываются более чем на 600 и 1000 процентных пунктов; акустический признак полезен лишь как тонкое разрешение почти равных языковых вариантов.

Вариант оценки звуковой совместимостиДоля исправленных галлюцинацийКомментарий
Среднее последних 4 слоёв53,1%Лучший вариант абляции Qwen3
Среднее последних 2 слоёв51,6%Небольшая потеря
Среднее по времени48,5%Хуже объединения вниманием
Только последний слой41,0%Заметная потеря
LC-DoLa46,0%Языковая межслойная точка сравнения
Только звук, без ограничения правдоподобияне сопоставимоРост WER/CER >600/>1000 п.п.

Как это читать: первые строки меняют способ извлечения звукового сигнала при сохранённом ограничении кандидатов. Последняя строка показывает, что акустический балл не является самостоятельным распознавателем и должен работать внутри узкого языкового коридора.

Оригинальная статья на arXiv