Room-acoustic simulations: wave/hybrid RIR реально снижает WER после enhancement
Это аккуратная room-acoustics работа с прямым downstream-критерием: авторы не меняют архитектуру enhancement-модели, а проверяют, насколько физическая точность room-acoustic simulation влияет на ASR после multichannel speech enhancement. Вывод практичный: SpatialNet, обученный на high-fidelity hybrid simulations, даёт до 38% relative reduction median WER по сравнению с image-source augmentations.
Метод. Сравниваются три training datasets для SpatialNet. ISM-U использует image-source simulation с room dimensions и reverberation targets, случайно выбранными из диапазонов. ISM-M остаётся геометрическим, но параметры подбираются из более реалистичных material/room libraries. Hybrid dataset использует wave-based simulation ниже crossover frequency и geometrical acoustics выше, чтобы лучше поймать low/mid-frequency modal behaviour, diffraction и frequency-dependent decay. Evaluation делается на LibriCSS-EM6: 60 sessions с measured Eigenmike RIR из Motus и Arni6DoF, diffuse noise при SNR 0–20 dB и Kaldi ASR pipeline с LibriSpeech 4-gram LM.
Результаты. Hybrid consistently выигрывает у ISM-augmentation. Overall улучшение против ISM-U: absolute median WER −4.29 пункта, relative −30.0% с 95% CI [25.0, 31.7]. Против более сильного ISM-M: −1.93 пункта и −16.3% relative с CI [12.9, 20.0]. Эффект растёт при overlap: в OV40 Hybrid лучше ISM-U на 8.18 WER points / 38.3% relative, а лучше ISM-M на 4.00 points / 23.5%. При 0L против ISM-M доверительный интервал включает отрицательную границу, так что там авторы не должны заявлять устойчивую победу.
Ограничения. Работа проверяет один enhancement backbone, SpatialNet, и один measured evaluation setup вокруг Eigenmike/LibriCSS-style сценария. Метрика завязана на старый, но воспроизводимый Kaldi ASR pipeline; современные neural ASR могут иметь другой профиль чувствительности. Hybrid simulation дороже и инфраструктурно сложнее, а статья не даёт полной cost-benefit оценки времени генерации RIR против выигрыша WER.
Фишка из статьи. Самая сильная часть — таблица по overlap conditions: физически более точные RIR особенно помогают там, где enhancement сложнее из-за overlapping speakers. Это не косметическое улучшение PESQ, а падение downstream WER на measured rooms.
| Condition | Hybrid vs ISM-U | Relative ↓ | Hybrid vs ISM-M | Relative ↓ |
|---|---|---|---|---|
| 0S | 2.17 WER pts | 26.7% | 1.19 WER pts | 16.7% |
| OV20 | 6.15 WER pts | 33.3% | 2.21 WER pts | 15.6% |
| OV30 | 6.14 WER pts | 34.6% | 3.20 WER pts | 22.2% |
| OV40 | 8.18 WER pts | 38.3% | 4.00 WER pts | 23.5% |
| Overall | 4.29 WER pts | 30.0% | 1.93 WER pts | 16.3% |
Как это читать: если enhancement training data генерируется слишком простым room model, модель учится на акустике, которая не совпадает с measured rooms. Hybrid RIR улучшает именно generalization на реальных комнатных импульсных характеристиках.