Распознавание речи Галлюцинации Отказ от ответа
arXiv cs.CL

The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT

arXiv:2608.15940

Распознаватель может уверенно написать фразу по тишине, музыке или комнатному шуму, хотя в декодере уже есть служебный знак окончания, способный сигнализировать «сообщения нет». Авторы исследуют этот знак как внутренний канал отказа от ответа и показывают важный предел: усилить его легко, но цена в виде удаления настоящей речи быстро становится неприемлемой. Это скорее строгий аудит рабочей точки, чем готовое средство развёртывания.

Метод. Исследование включает 1060 проверочных фрагментов, закрытую после настройки выборку 300 неречевых и 300 речевых записей и 15 моделей разных семейств. Для Whisper анализируются скрытые состояния и логиты EOT/no-speech; далее сравниваются постоянное смещение логита EOT, обучение одной строки выходной матрицы и аналитическая добавка направления. Для CTC/RNN-T аналогично рассматривается blank, для машинного перевода - EOS. Итоговый критерий Ck складывает число выдуманных слов в минуту и число удалённых настоящих слов в минуту с весом k.

Результаты. На исходной батарее Whisper-small выдаёт буквенный текст на 96,2% неречевых фрагментов. Обученная строка EOT почти обнуляет этот показатель, но на закрытой выборке снижение частоты непустых ответов с 91,7% до 3,3% сопровождается ростом удалений с 1,58 до 33,05 слова в минуту. Ошибочно заглушаются 42,7% записей с низким отношением сигнал/шум и 38,7% акцентной речи. При малой цене удаления выгодно постоянное смещение b=5, а начиная с k=2 исходная модель уже имеет меньшую суммарную стоимость. На длинной записи обычное разбиение по VAD даёт WER 4,5%, тогда как правка EOT - 21,1%.

Ограничения. Исследование покрывает только целиком пустые отрезки и не обнаруживает выдумки, вставленные внутрь настоящей расшифровки. Основные вмешательства проверены при жадном декодировании коротких фрагментов; поиск луча и непрерывный длинный звук не охвачены. Закрытая выборка невелика и не содержит запланированной спонтанной речи. Веса стоимости иллюстративны, неопределённость ранжирования не оценена, а подготовленный архив воспроизводимости пока не имеет публичного адреса.

Фишка из статьи. Таблица закрытого испытания показывает разворот победителя при изменении цены ложного молчания. Минимальная частота выдумок сама по себе является плохой целью.

ВариантВыдуманные слова/минУдалённые слова/минC0,5C1C2
Исходная модель32,51,633,334,135,7
Обученная строка EOT4,333,020,837,370,4
Постоянное смещение b=510,117,618,927,745,3
Аналитическая добавка35,417,444,152,870,1

Как это читать: если одно удалённое слово стоит вдвое дороже одного выдуманного, исходная модель уже предпочтительнее всех правок. Практический отказ от ответа требует целевой калибровки, VAD и явной функции риска, а не максимального подавления текста на шуме.

Оригинальная статья на arXiv