речевые языковые модели отказ от ответа проверка входа
arXiv eess.AS

SURE-Challenge: Evaluating Speech Evidence Before Speech-LLM Generation

arXiv:2608.27783

SURE ставит перед речевой языковой моделью отдельный входной фильтр: прежде чем генерировать ответ, система решает, содержит ли запись вообще достаточное речевое свидетельство. Такой допуск полезен против галлюцинаций на тишине, музыке, шуме и вокальных звуках, а также экономит дорогие обращения к основной модели.

Метод. Фильтр сочетает простую энергию, обнаружение речевой активности и среднюю максимальную вероятность токенов Whisper-small. Порог 0,70 выбран на отладочной части так, чтобы не отклонять поддержанные примеры. Расширенный набор содержит 474 записи, включая 204 неподдержанных; проверяются шесть речевых языковых моделей, а также отдельные фильтры Energy, Silero, AST и скор уверенности распознавателя.

Результаты. Для Qwen2 исходная система отклоняет лишь 15 из 204 неподдержанных записей, а SURE — 196, то есть 96,1%, при неизменной точности 93,0% на поддержанных вопросах. Число вызовов генератора уменьшается с 474 до 278, на 41%. На H100 проверка поддержки занимает 0,012 с, Whisper — 0,080 с, а сама Qwen2 — 0,949 с на запись. Результат 96,1% повторяется у всех шести основных моделей, поскольку решение вынесено перед ними.

Ограничения. Неподдержанные условия в основном собраны или возмущены программно; нет детской, дизартрической и существенно диалектной речи. Порог 0,90 повышает внешний отказ до 96,4%, но оставляет лишь 50,5% поддержанной английской речи. Фильтр оценивает наличие распознаваемой речи, а не достаточность смысла для конкретного вопроса.

Фишка из статьи. Внешние срезы показывают, где уверенность Whisper перестаёт быть надёжным признаком. SURE почти всегда отбрасывает MUSAN, но пропускает большую часть перекрывающейся речи LibriCSS и более половины естественного лепета без искусственного ускорения — именно там источник звучит речеподобно, хотя ответа не содержит.

Внешний срезЖелательное действиеДоля верных решений SURE
Common VoiceПропустить речь84,7%
FLEURSПропустить речь100,0%
ESCОтклонить87,4%
FSD musicОтклонить81,2%
MUSANОтклонить95,0%
VocalSoundОтклонить85,8%
LibriCSS, перекрытиеОтклонить9,2%
Естественный лепетОтклонить42,6%

Как это читать: фильтр хорошо различает речь и явный неречевой звук, но значительно хуже решает более содержательную задачу «можно ли ответить по этой речи». Поэтому его стоит рассматривать как дешёвый первый рубеж, а не как полную проверку доказательности.

Оригинальная статья на arXiv