Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones
Статья оценивает относительную передаточную матрицу между двумя группами микрофонов при нескольких источниках. Это полезное расширение относительной передаточной функции для распределенных решеток, но главный результат неожиданен: модель, которая точнее всего восстанавливает саму матрицу, хуже всего работает в последующем улучшении речи.
Метод. Сравниваются три оценщика: сверточная SCoNet в области STFT, временная FuSNet и рекуррентная LAeNet на LSTM. Они получают многоканальные ковариационные или временные признаки и предсказывают ReTM, после чего одна и та же оценка используется в пространственном фильтре для подавления шума. Эксперименты синтетические: комната 6x7x3 м, время реверберации 500 мс, нерегулярное расположение микрофонов и смеси шума, речи и музыки.
Результаты. В сценарии C средний SDR оценки ReTM растет с 23,25 дБ у ковариационного базового метода до 27,85 у SCoNet, 38,88 у FuSNet и 28,57 у LAeNet. Однако в улучшении речи при том же сценарии LAeNet дает SDR 7,03 дБ и STOI 0,91, SCoNet - 4,96/0,87, базовый метод - 4,07/0,85, а FuSNet проваливается до -1,19/0,67. При четырех микрофонах на входе и трех на выходе FuSNet работает 1,07 мс, SCoNet - 6,77 мс, LAeNet - около 1,80 с.
Ограничения. Все данные получены в одной моделируемой комнате с фиксированным T60; оценщик обучается на минутном шумовом сигнале, а реальная перестановка микрофонов и движение источников не проверены. Формального прослушивания нет, лишь неформальные наблюдения авторов. LAeNet дает лучший конечный результат, но слишком медленна для оперативного применения. Связь между метрикой ошибки ReTM и качеством пространственного фильтра остается не объясненной.
Фишка из статьи. Это хороший отрицательный результат: низкая ошибка промежуточной физической величины не гарантирует хороший сигнал после фильтрации.
| Метод, сценарий C | SDR оценки ReTM | SDR улучшенной речи | STOI |
|---|---|---|---|
| Ковариационный базовый | 23,25 дБ | 4,07 дБ | 0,85 |
| SCoNet | 27,85 дБ | 4,96 дБ | 0,87 |
| FuSNet | 38,88 дБ | -1,19 дБ | 0,67 |
| LAeNet | 28,57 дБ | 7,03 дБ | 0,91 |
Как это читать: FuSNet выигрывает по SDR самой матрицы с большим запасом, но дает худшее улучшение речи. Вероятно, агрегированная ошибка ReTM не взвешивает фазовые и частотные отклонения так, как их усиливает последующий пространственный фильтр; выбирать оценщик только по промежуточной метрике опасно.