Beamforming Covariance STFT
Beamforming DSP

Covariance upsampling: виртуальный 32-mic array из 4 микрофонов для acoustic imaging

RMSE 0.432

Статья полезна для spatial audio и beamforming: вместо того чтобы физически ставить 32 микрофона, авторы пробуют восстановить 32-channel spatial covariance matrix из 4-channel tetrahedral array. Это не speech enhancement напрямую, но работа находится рядом с практическими задачами sparse arrays, acoustic imaging и time-frequency covariance modeling.

Метод. Вход строится из STFT с Hann window, FFT length 512, 50% hop и sample rate 24 kHz. Для каждого time-frequency bin считается spatial covariance matrix, затем instantaneous SCM сглаживаются до 5 SCM/s. Hermitian covariance раскладывается в real-valued convolution channels: для 4 микрофонов это компактное представление, а целевой выход соответствует spherical 32-microphone array. Сравниваются Base CNN, Expanded CNN и варианты с Frequency Dynamic Convolution.

Результаты. Все нейросетевые варианты лучше random guess RMSE 0.548. Base CNN с 6.29M параметров дает RMSE 0.452; Expanded CNN с 191.29M — 0.433; лучший Hybrid FDC-CNN Expanded с 192.09M параметров и 4.82 GB peak GPU memory достигает RMSE 0.432. Full FDC-CNN оказывается хуже: 539.36M параметров, 10.13 GB памяти и RMSE 0.451. Авторы также отмечают, что ошибка растет к высоким частотам из-за aliasing limit 4-channel input, но модели остаются лучше random guess по частотам.

Ограничения. Это acoustic imaging experiment на STARSS23, а не проверка downstream ASR/SELD/WER. Геометрия 4→32 array фиксирована; перенос на другие layouts требует переобучения или отдельной валидации. Качественные heatmaps выглядят более сфокусированными, но авторы отмечают, что модель может игнорировать reflections/reverberation, а hyperparameter optimization не проводился.

Фишка из статьи. Здесь есть хороший negative result: “больше FDC везде” не помогает. Частотно-зависимая convolution полезна как аккуратная добавка, но полный FDC-заменитель раздут по параметрам и хуже по RMSE.

АрхитектураПараметрыPeak GPU memoryRMSE
Random guess0.548
Base CNN6.29M2.03 GB0.452
Expanded CNN191.29M4.81 GB0.433
Hybrid FDC-CNN Base6.69M2.04 GB0.447
Hybrid FDC-CNN Expanded192.09M4.82 GB0.432
Full FDC-CNN539.36M10.13 GB0.451

Как это читать: лучший результат дает не максимальная модель, а компромисс — expanded capacity плюс FDC только там, где частотная зависимость реально помогает. Для embedded/sparse-array задач это важнее, чем абсолютное RMSE: full FDC стоит в 2 раза больше памяти, чем hybrid expanded, и почти возвращается к Base CNN по качеству.

Оригинальная статья на arXiv