Likelihood-Constrained Acoustic Reranking for Training-Free Hallucination Mitigation in LLM-Based ASR
LCAR уменьшает галлюцинации больших моделей распознавания без обучения и внешнего детектора. Вместо свободной замены токена метод рассматривает только почти столь же вероятные продолжения, как жадное, и среди них предпочитает вариант, лучше согласованный со звуковым представлением.
Метод. На каждом шаге допускаются токены, чья логарифмическая вероятность отстаёт от лучшего не более чем на δ; EOS не переопределяется. Звуковая совместимость вычисляется из объединённых вниманием представлений аудио через уже имеющуюся выходную голову модели. При δ=0 алгоритм точно совпадает с жадным декодированием; основная настройка δ=0,60 допускает кандидата с вероятностью не ниже 54,9% от вероятности лидера.
Результаты. Испытаны Qwen3-ASR-1.7B, Qwen2-Audio-7B Base, Kimi-Audio-7B и GLM-ASR-Nano на двух вручную проверенных стресс-наборах по 500 записей. При δ=0,60 средний набор содержит лишь 1,076 кандидата, меняется 4,0% токенов, а обычный WER/CER сдвигается от −0,154 до +0,129 пункта в зависимости от модели. Чистое исправление галлюцинаций положительно во всех системах: 5,7–43,7 пункта на синтетической речи и 52,8–70,9 на OpenSpeech. Из 3997 обнаруженных событий 28,8% заканчиваются точным восстановлением, а 52% превращаются в обычную ошибку распознавания.
Ограничения. Наборы специально обогащены галлюцинациями и не оценивают их распространённость в обычном потоке. Проверены главным образом китайско-английские модели, потоковый вывод не исследован, а реализация требует доступа к внутренним состояниям и вниманию. Детектор событий строился с участием Qwen3-32B и ручной проверки; устранение галлюцинации не гарантирует точную расшифровку.
Фишка из статьи. Абляция показывает, зачем нужно ограничение правдоподобия. Если выбирать токен только по звуковой совместимости, WER и CER взрываются более чем на 600 и 1000 процентных пунктов; акустический признак полезен лишь как тонкое разрешение почти равных языковых вариантов.
| Вариант оценки звуковой совместимости | Доля исправленных галлюцинаций | Комментарий |
|---|---|---|
| Среднее последних 4 слоёв | 53,1% | Лучший вариант абляции Qwen3 |
| Среднее последних 2 слоёв | 51,6% | Небольшая потеря |
| Среднее по времени | 48,5% | Хуже объединения вниманием |
| Только последний слой | 41,0% | Заметная потеря |
| LC-DoLa | 46,0% | Языковая межслойная точка сравнения |
| Только звук, без ограничения правдоподобия | не сопоставимо | Рост WER/CER >600/>1000 п.п. |
Как это читать: первые строки меняют способ извлечения звукового сигнала при сохранённом ограничении кандидатов. Последняя строка показывает, что акустический балл не является самостоятельным распознавателем и должен работать внутри узкого языкового коридора.