Enhancement Room acoustics WER
Room acoustics

Room-acoustic simulations: wave/hybrid RIR реально снижает WER после enhancement

−30% WER

Это аккуратная room-acoustics работа с прямым downstream-критерием: авторы не меняют архитектуру enhancement-модели, а проверяют, насколько физическая точность room-acoustic simulation влияет на ASR после multichannel speech enhancement. Вывод практичный: SpatialNet, обученный на high-fidelity hybrid simulations, даёт до 38% relative reduction median WER по сравнению с image-source augmentations.

Метод. Сравниваются три training datasets для SpatialNet. ISM-U использует image-source simulation с room dimensions и reverberation targets, случайно выбранными из диапазонов. ISM-M остаётся геометрическим, но параметры подбираются из более реалистичных material/room libraries. Hybrid dataset использует wave-based simulation ниже crossover frequency и geometrical acoustics выше, чтобы лучше поймать low/mid-frequency modal behaviour, diffraction и frequency-dependent decay. Evaluation делается на LibriCSS-EM6: 60 sessions с measured Eigenmike RIR из Motus и Arni6DoF, diffuse noise при SNR 0–20 dB и Kaldi ASR pipeline с LibriSpeech 4-gram LM.

Результаты. Hybrid consistently выигрывает у ISM-augmentation. Overall улучшение против ISM-U: absolute median WER −4.29 пункта, relative −30.0% с 95% CI [25.0, 31.7]. Против более сильного ISM-M: −1.93 пункта и −16.3% relative с CI [12.9, 20.0]. Эффект растёт при overlap: в OV40 Hybrid лучше ISM-U на 8.18 WER points / 38.3% relative, а лучше ISM-M на 4.00 points / 23.5%. При 0L против ISM-M доверительный интервал включает отрицательную границу, так что там авторы не должны заявлять устойчивую победу.

Ограничения. Работа проверяет один enhancement backbone, SpatialNet, и один measured evaluation setup вокруг Eigenmike/LibriCSS-style сценария. Метрика завязана на старый, но воспроизводимый Kaldi ASR pipeline; современные neural ASR могут иметь другой профиль чувствительности. Hybrid simulation дороже и инфраструктурно сложнее, а статья не даёт полной cost-benefit оценки времени генерации RIR против выигрыша WER.

Фишка из статьи. Самая сильная часть — таблица по overlap conditions: физически более точные RIR особенно помогают там, где enhancement сложнее из-за overlapping speakers. Это не косметическое улучшение PESQ, а падение downstream WER на measured rooms.

ConditionHybrid vs ISM-URelative ↓Hybrid vs ISM-MRelative ↓
0S2.17 WER pts26.7%1.19 WER pts16.7%
OV206.15 WER pts33.3%2.21 WER pts15.6%
OV306.14 WER pts34.6%3.20 WER pts22.2%
OV408.18 WER pts38.3%4.00 WER pts23.5%
Overall4.29 WER pts30.0%1.93 WER pts16.3%

Как это читать: если enhancement training data генерируется слишком простым room model, модель учится на акустике, которая не совпадает с measured rooms. Hybrid RIR улучшает именно generalization на реальных комнатных импульсных характеристиках.

Оригинальная статья на arXiv