SURE-Challenge: Evaluating Speech Evidence Before Speech-LLM Generation
SURE ставит перед речевой языковой моделью отдельный входной фильтр: прежде чем генерировать ответ, система решает, содержит ли запись вообще достаточное речевое свидетельство. Такой допуск полезен против галлюцинаций на тишине, музыке, шуме и вокальных звуках, а также экономит дорогие обращения к основной модели.
Метод. Фильтр сочетает простую энергию, обнаружение речевой активности и среднюю максимальную вероятность токенов Whisper-small. Порог 0,70 выбран на отладочной части так, чтобы не отклонять поддержанные примеры. Расширенный набор содержит 474 записи, включая 204 неподдержанных; проверяются шесть речевых языковых моделей, а также отдельные фильтры Energy, Silero, AST и скор уверенности распознавателя.
Результаты. Для Qwen2 исходная система отклоняет лишь 15 из 204 неподдержанных записей, а SURE — 196, то есть 96,1%, при неизменной точности 93,0% на поддержанных вопросах. Число вызовов генератора уменьшается с 474 до 278, на 41%. На H100 проверка поддержки занимает 0,012 с, Whisper — 0,080 с, а сама Qwen2 — 0,949 с на запись. Результат 96,1% повторяется у всех шести основных моделей, поскольку решение вынесено перед ними.
Ограничения. Неподдержанные условия в основном собраны или возмущены программно; нет детской, дизартрической и существенно диалектной речи. Порог 0,90 повышает внешний отказ до 96,4%, но оставляет лишь 50,5% поддержанной английской речи. Фильтр оценивает наличие распознаваемой речи, а не достаточность смысла для конкретного вопроса.
Фишка из статьи. Внешние срезы показывают, где уверенность Whisper перестаёт быть надёжным признаком. SURE почти всегда отбрасывает MUSAN, но пропускает большую часть перекрывающейся речи LibriCSS и более половины естественного лепета без искусственного ускорения — именно там источник звучит речеподобно, хотя ответа не содержит.
| Внешний срез | Желательное действие | Доля верных решений SURE |
|---|---|---|
| Common Voice | Пропустить речь | 84,7% |
| FLEURS | Пропустить речь | 100,0% |
| ESC | Отклонить | 87,4% |
| FSD music | Отклонить | 81,2% |
| MUSAN | Отклонить | 95,0% |
| VocalSound | Отклонить | 85,8% |
| LibriCSS, перекрытие | Отклонить | 9,2% |
| Естественный лепет | Отклонить | 42,6% |
Как это читать: фильтр хорошо различает речь и явный неречевой звук, но значительно хуже решает более содержательную задачу «можно ли ответить по этой речи». Поэтому его стоит рассматривать как дешёвый первый рубеж, а не как полную проверку доказательности.