Wiener filtering WASN DSP
DSP / Speech enhancement

TI-dMWF: distributed multichannel Wiener filtering для acoustic sensor networks

STOI 0.76

TI-dMWF предлагает topology-independent distributed multichannel Wiener filter для wireless acoustic sensor networks, где каждый node должен оценивать свой desired speech signal без передачи всех raw microphone signals в центр. Это важная DSP-задача для distributed hearing aids, smart rooms и ad-hoc microphone arrays: централизованный MWF оптимален, но коммуникационно дорог, а iterative TI-DANSE требует множества итераций. Главный ход авторов - передавать low-dimensional fused signals по pruned tree так, чтобы root node восстанавливал centralized node-specific MWF solution в один проход при определенной модели наблюдаемости.

Метод. Для каждого target node строится rooted spanning tree; downstream nodes вычисляют LMMSE fusion matrices и отправляют fused signals к root. Алгоритм доказывается optimal в GLS scenario, где каждый source либо global и наблюдается всеми nodes, либо local и наблюдается ровно одним node. В отличие от TI-DANSE/TI-DANSE+, TI-dMWF не итеративен: discovery/fusion и estimation step повторяются для каждого root, а filters recompute every N_us frames.

Результаты. В oracle cGLS scenarios с K=6 nodes и M_k=5 microphones TI-dMWF достигает centralized MWF performance до machine precision MSE_W, тогда как TI-DANSE+ и TI-DANSE требуют около 30 и 82 iterations соответственно, чтобы превзойти local MWF. В reverberant simulation: комната 5x5x3 m, T60=0.2 s, 2 VCTK speech sources, 2 babble noise sources, 0 dB mean SNR, WOLA 1024 DFT. При estimated SCMs TI-dMWF достигает converged all-node STOI 0.76 против 0.77 у centralized GEVD-MWF, 0.66 у local GEVD-MWF и 0.63 у unprocessed reference.

Ограничения. Exact optimality ограничена GLS scenario: если source наблюдается строгим subset из двух и более nodes, достаточность fused signals нарушается, и качество деградирует, хотя авторы показывают smooth degradation. Алгоритм требует knowledge или оценки observability pattern и обновления trees/fusion matrices при изменении topology. Реальная проверка пока simulation-based; live WASN с packet loss, clock drift и moving speakers остается отдельной задачей.

Фишка из статьи. Практический блок - estimated-SCM simulation с imperfect VAD. Он показывает, что одношаговый distributed filter почти догоняет centralized estimator, но чувствителен к ошибкам VAD.

УсловиеМетрикаЗначениеКомментарий
Centralized GEVD-MWFSTOI0.77верхняя practical reference при estimated SCMs
TI-dMWF, perfect VADSTOI0.76почти centralized quality без raw-signal centralization
Local GEVD-MWFSTOI0.66локальная обработка заметно хуже
UnprocessedSTOI0.63исходный noisy reference
TI-dMWF, VAD error p_e=0.05 / 0.1STOI0.74 / 0.66качество монотонно падает при ошибках VAD

Как это читать: алгоритм интересен не только proof of optimality, но и тем, что при estimated SCMs дает 0.76 STOI против 0.77 centralized. Однако при p_e=0.1 он падает до 0.66, так что robustness к source activity estimation остается ключевым bottleneck.

Оригинальная статья на arXiv