Улучшение речи Лучеформирование Wiener
arXiv cs.SD

Cloud-Boosted Enhancement: многоканальное улучшение речи с серверной подсказкой

arXiv:2608.07423

Эта работа про низкозадержечное многоканальное улучшение речи на слабом носимом устройстве, где локальная модель не может быть большой. Авторы используют серверную модель не как замену локальной, а как задержанную подсказку: сервер присылает более качественные признаки и оценки статистик, а крайняя модель остается легкой и причинной. Особенно релевантна DSP-часть: итоговый блок сливает ковариационные матрицы для многоканального фильтра Винера и лучеформирования.

Метод. В системе три добавки к TinyGRU+MCWF: задержанный серверный выход подается как дополнительный вход, промежуточные серверные признаки передаются через layerwise feature boosting, а collaborative MCWF смешивает серверные и локальные ковариационные оценки. Данные моделируются из DNS-Challenge: 8-канальная круговая микрофонная решетка, RIR через Pyroomacoustics, комнаты от 3x3x2 до 10x10x5 м, коэффициент поглощения стен 0.1-0.7, 8-16 мешающих дикторов с вероятностью 0.5 и диффузный шум. Проверяются standard SNR [-5,10] дБ и challenging SNR [-10,-5] дБ.

Результаты. Базовый TinyGRU+MCWF улучшает standard SI-SDR с -4.96 до 1.97 дБ и STOI с 69.27% до 82.36%, но на challenging получает только -1.16 дБ SI-SDR. Полная схема при задержке 64 мс дает 5.74 дБ SI-SDR, PESQ 2.33 и STOI 85.48% на standard, а на challenging - 2.33 дБ, PESQ 1.95 и STOI 73.73%. Это +3.77 и +3.49 дБ SI-SDR к базовой локальной модели при росте параметров всего на 1.5% и MMACs на 2.4%.

Ограничения. Эксперименты синтетические: комнаты, помехи и RIR моделируются, а не записываются в реальных носимых условиях. Система зависит от сетевой задержки и доступности сервера; при 96 и 128 мс качество падает, хотя остается выше базы. Также серверная SpatialNet заметно сильнее: 11.79 дБ SI-SDR на standard и 9.08 дБ на challenging, так что крайняя система все еще далеко от верхней границы.

Фишка из статьи. Важная инженерная проверка: улучшение нельзя объяснить тем, что локальную модель просто сделали больше. Увеличенная TinyGRU почти втрое тяжелее по параметрам, но проигрывает серверно-краевой схеме.

МодельПараметрыMMACsSI-SDR standardSI-SDR challenging
TinyGRU+MCWF145.1K32.9M1.97 дБ-1.16 дБ
TinyGRU-Large+MCWF432.4K68.77M2.75 дБ-0.37 дБ
Полная cloud-boosted схема, 64 мс147.3K33.7M5.74 дБ2.33 дБ
Полная схема, 128 мс147.3K33.7M4.26 дБ1.07 дБ

Как это читать: SI-SDR выше означает лучшее выделение целевой речи. Серверная подсказка и совместный фильтр Винера дают больше, чем грубое масштабирование локальной GRU, при этом добавляют мало локальных вычислений.

Оригинальная статья на arXiv