Covariance upsampling: виртуальный 32-mic array из 4 микрофонов для acoustic imaging
Статья полезна для spatial audio и beamforming: вместо того чтобы физически ставить 32 микрофона, авторы пробуют восстановить 32-channel spatial covariance matrix из 4-channel tetrahedral array. Это не speech enhancement напрямую, но работа находится рядом с практическими задачами sparse arrays, acoustic imaging и time-frequency covariance modeling.
Метод. Вход строится из STFT с Hann window, FFT length 512, 50% hop и sample rate 24 kHz. Для каждого time-frequency bin считается spatial covariance matrix, затем instantaneous SCM сглаживаются до 5 SCM/s. Hermitian covariance раскладывается в real-valued convolution channels: для 4 микрофонов это компактное представление, а целевой выход соответствует spherical 32-microphone array. Сравниваются Base CNN, Expanded CNN и варианты с Frequency Dynamic Convolution.
Результаты. Все нейросетевые варианты лучше random guess RMSE 0.548. Base CNN с 6.29M параметров дает RMSE 0.452; Expanded CNN с 191.29M — 0.433; лучший Hybrid FDC-CNN Expanded с 192.09M параметров и 4.82 GB peak GPU memory достигает RMSE 0.432. Full FDC-CNN оказывается хуже: 539.36M параметров, 10.13 GB памяти и RMSE 0.451. Авторы также отмечают, что ошибка растет к высоким частотам из-за aliasing limit 4-channel input, но модели остаются лучше random guess по частотам.
Ограничения. Это acoustic imaging experiment на STARSS23, а не проверка downstream ASR/SELD/WER. Геометрия 4→32 array фиксирована; перенос на другие layouts требует переобучения или отдельной валидации. Качественные heatmaps выглядят более сфокусированными, но авторы отмечают, что модель может игнорировать reflections/reverberation, а hyperparameter optimization не проводился.
Фишка из статьи. Здесь есть хороший negative result: “больше FDC везде” не помогает. Частотно-зависимая convolution полезна как аккуратная добавка, но полный FDC-заменитель раздут по параметрам и хуже по RMSE.
| Архитектура | Параметры | Peak GPU memory | RMSE |
|---|---|---|---|
| Random guess | — | — | 0.548 |
| Base CNN | 6.29M | 2.03 GB | 0.452 |
| Expanded CNN | 191.29M | 4.81 GB | 0.433 |
| Hybrid FDC-CNN Base | 6.69M | 2.04 GB | 0.447 |
| Hybrid FDC-CNN Expanded | 192.09M | 4.82 GB | 0.432 |
| Full FDC-CNN | 539.36M | 10.13 GB | 0.451 |
Как это читать: лучший результат дает не максимальная модель, а компромисс — expanded capacity плюс FDC только там, где частотная зависимость реально помогает. Для embedded/sparse-array задач это важнее, чем абсолютное RMSE: full FDC стоит в 2 раза больше памяти, чем hybrid expanded, и почти возвращается к Base CNN по качеству.