Акустика помещений Микрофонные решетки Улучшение речи
arXiv eess.AS

Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones

arXiv:2608.11627

Статья оценивает относительную передаточную матрицу между двумя группами микрофонов при нескольких источниках. Это полезное расширение относительной передаточной функции для распределенных решеток, но главный результат неожиданен: модель, которая точнее всего восстанавливает саму матрицу, хуже всего работает в последующем улучшении речи.

Метод. Сравниваются три оценщика: сверточная SCoNet в области STFT, временная FuSNet и рекуррентная LAeNet на LSTM. Они получают многоканальные ковариационные или временные признаки и предсказывают ReTM, после чего одна и та же оценка используется в пространственном фильтре для подавления шума. Эксперименты синтетические: комната 6x7x3 м, время реверберации 500 мс, нерегулярное расположение микрофонов и смеси шума, речи и музыки.

Результаты. В сценарии C средний SDR оценки ReTM растет с 23,25 дБ у ковариационного базового метода до 27,85 у SCoNet, 38,88 у FuSNet и 28,57 у LAeNet. Однако в улучшении речи при том же сценарии LAeNet дает SDR 7,03 дБ и STOI 0,91, SCoNet - 4,96/0,87, базовый метод - 4,07/0,85, а FuSNet проваливается до -1,19/0,67. При четырех микрофонах на входе и трех на выходе FuSNet работает 1,07 мс, SCoNet - 6,77 мс, LAeNet - около 1,80 с.

Ограничения. Все данные получены в одной моделируемой комнате с фиксированным T60; оценщик обучается на минутном шумовом сигнале, а реальная перестановка микрофонов и движение источников не проверены. Формального прослушивания нет, лишь неформальные наблюдения авторов. LAeNet дает лучший конечный результат, но слишком медленна для оперативного применения. Связь между метрикой ошибки ReTM и качеством пространственного фильтра остается не объясненной.

Фишка из статьи. Это хороший отрицательный результат: низкая ошибка промежуточной физической величины не гарантирует хороший сигнал после фильтрации.

Метод, сценарий CSDR оценки ReTMSDR улучшенной речиSTOI
Ковариационный базовый23,25 дБ4,07 дБ0,85
SCoNet27,85 дБ4,96 дБ0,87
FuSNet38,88 дБ-1,19 дБ0,67
LAeNet28,57 дБ7,03 дБ0,91

Как это читать: FuSNet выигрывает по SDR самой матрицы с большим запасом, но дает худшее улучшение речи. Вероятно, агрегированная ошибка ReTM не взвешивает фазовые и частотные отклонения так, как их усиливает последующий пространственный фильтр; выбирать оценщик только по промежуточной метрике опасно.

Оригинальная статья на arXiv