дальнее распознавание речи акустика помещений робастность
arXiv cs.SD

FFASR: оценка дальнего распознавания речи на высокоточных моделируемых импульсных характеристиках помещений

arXiv:2609.38897

FFASR проверяет, насколько реалистичная физическая симуляция помещения предсказывает ошибки дальнего распознавания речи. Вместо простого свёртывания с геометрическими RIR авторы используют гибридное волновое и лучевое моделирование, добавляют движущегося говорящего и сопоставляют один виртуальный офис с измеренной комнатой.

Метод. Набор содержит 15 637 фрагментов общей длительностью 54,9 часа: 15 дикторов, 14 помещений и девять сочетаний расстояния, шума и движения. Несколько моделей Whisper тестируются без адаптации. Для проверки переноса сравниваются измеренные и моделируемые RIR одной лаборатории, а движение реализуется как меняющаяся во времени акустическая траектория.

Результаты. Средний WER для ближней речи равен 4,4%, для измеренной лаборатории — 29,0%, для её симуляции — 27,7%; средний абсолютный разрыв составляет 1,7 п.п. В статике WER растёт от 10,1% при высоком SNR до 41,3% при низком; движение повышает эти значения до 11,5, 23,2 и 43,5%.

Ограничения. Хотя RIR многоканальные, распознавание оценивается в моно. Реальная проверка проведена для одного офиса, речь читаемая и англоязычная, дикторов всего 15; нет спонтанной речи, перекрытий и реального движущегося измерения с совпадающими начальными условиями.

Фишка из статьи. В низком SNR маленькие Whisper переходят от ошибок распознавания к массовым вставкам: WER превышает 100%, что возможно только при генерации лишних слов. Такая деградация почти не видна на чистом тесте, но важна для оценки галлюцинаций в помещении.

УсловиеСтатический WERДвижущийся WERШтраф за движение
Высокий SNR10,1%11,5%+1,3 п.п.
Средний SNR20,5%23,2%+2,7 п.п.
Низкий SNR41,3%43,5%+2,2 п.п.
Whisper base / tiny, низкий SNR117% / 137%—Преобладают вставки

Как это читать: движение хуже всего влияет на средний SNR, но крайний низкий SNR раскрывает другой класс отказа — модель не только пропускает речь, а уверенно дописывает несуществующий текст.

Оригинальная статья на arXiv