Улучшение речи Микрофонные массивы Акустика
Улучшение речи

Geo-DConv: улучшение речи для разных микрофонных массивов

OVRL 2.73

Многоканальное улучшение речи обычно хорошо работает только с той геометрией микрофонного массива, под которую модель обучали. Geo-DConv делает этот случай практичнее: координаты микрофонов становятся явной подсказкой для динамической свертки, поэтому одна система может работать с разными числами микрофонов и разными конфигурациями. Это хорошая работа на стыке речевого улучшения, акустики помещений и пространственной обработки сигналов.

Метод. Авторы не строят новую систему с нуля, а берут сильные фиксированные модели SpatialNet и TF-GridNet и заменяют часть сверток на Geometry-Aware Dynamic Convolution. Координаты микрофонов проходят через Topology-Aware Coordinate Transformer, который формирует параметры свертки с учетом взаимного расположения сенсоров. Обучение идет на RealMAN с реальными многоканальными записями; главный сценарий - geometry-invariant, где на выводе массив может отличаться от обучающего.

Результаты. В geometry-invariant сравнении на RealMAN SpatialNet-Geo-DConv получает SI-SDR 4.22 dB, PESQ 2.48 и DNSMOS OVRL 2.68, улучшая USES2-comp по SI-SDR и OVRL при меньшей вычислительной цене, чем у TF-GridNet. TF-GridNet-Geo-DConv дает лучший OVRL 2.77 и PESQ 2.59. На CHiME-4 без дообучения OVRL растет с 1.42 у необработанного сигнала до 2.64 для SpatialNet-Geo-DConv и 2.73 для TF-GridNet-Geo-DConv, хотя обучение было только на RealMAN и максимум четырех микрофонах.

Ограничения. Нужны корректные координаты микрофонов; в устройствах с неточной калибровкой это отдельная инженерная проблема. Проверка ограничена RealMAN и CHiME-4, а субъективной оценки нет. Работа показывает качество и стоимость обработки, но не разбирает потоковую задержку, устойчивость к движущимся источникам и реальные сбои геометрии.

Фишка из статьи. Самое ценное - обобщение на другой массив, а не только средний выигрыш на RealMAN. Модели обучали максимум на четырех микрофонах, но они сохраняют качество на пяти микрофонах и на шестиканальном CHiME-4.

Модель1 микрофон SI-SDR/PESQ/OVRL5 микрофонов SI-SDR/PESQ/OVRLCHiME-4 OVRL
USES2-comp-4.16 / 1.81 / 1.904.91 / 2.60 / 2.592.55
SpatialNet-Geo-DConv2.30 / 2.15 / 2.574.65 / 2.53 / 2.692.64
TF-GridNet-Geo-DConv2.76 / 2.37 / 2.704.54 / 2.67 / 2.792.73

Как это читать: Geo-DConv особенно заметен в крайних условиях. Даже в одномикрофонном режиме он не проваливается как USES2-comp, а на CHiME-4 дает прирост OVRL без настройки под этот массив.

Оригинальная статья на arXiv