Cloud-Boosted Enhancement: многоканальное улучшение речи с серверной подсказкой
Эта работа про низкозадержечное многоканальное улучшение речи на слабом носимом устройстве, где локальная модель не может быть большой. Авторы используют серверную модель не как замену локальной, а как задержанную подсказку: сервер присылает более качественные признаки и оценки статистик, а крайняя модель остается легкой и причинной. Особенно релевантна DSP-часть: итоговый блок сливает ковариационные матрицы для многоканального фильтра Винера и лучеформирования.
Метод. В системе три добавки к TinyGRU+MCWF: задержанный серверный выход подается как дополнительный вход, промежуточные серверные признаки передаются через layerwise feature boosting, а collaborative MCWF смешивает серверные и локальные ковариационные оценки. Данные моделируются из DNS-Challenge: 8-канальная круговая микрофонная решетка, RIR через Pyroomacoustics, комнаты от 3x3x2 до 10x10x5 м, коэффициент поглощения стен 0.1-0.7, 8-16 мешающих дикторов с вероятностью 0.5 и диффузный шум. Проверяются standard SNR [-5,10] дБ и challenging SNR [-10,-5] дБ.
Результаты. Базовый TinyGRU+MCWF улучшает standard SI-SDR с -4.96 до 1.97 дБ и STOI с 69.27% до 82.36%, но на challenging получает только -1.16 дБ SI-SDR. Полная схема при задержке 64 мс дает 5.74 дБ SI-SDR, PESQ 2.33 и STOI 85.48% на standard, а на challenging - 2.33 дБ, PESQ 1.95 и STOI 73.73%. Это +3.77 и +3.49 дБ SI-SDR к базовой локальной модели при росте параметров всего на 1.5% и MMACs на 2.4%.
Ограничения. Эксперименты синтетические: комнаты, помехи и RIR моделируются, а не записываются в реальных носимых условиях. Система зависит от сетевой задержки и доступности сервера; при 96 и 128 мс качество падает, хотя остается выше базы. Также серверная SpatialNet заметно сильнее: 11.79 дБ SI-SDR на standard и 9.08 дБ на challenging, так что крайняя система все еще далеко от верхней границы.
Фишка из статьи. Важная инженерная проверка: улучшение нельзя объяснить тем, что локальную модель просто сделали больше. Увеличенная TinyGRU почти втрое тяжелее по параметрам, но проигрывает серверно-краевой схеме.
| Модель | Параметры | MMACs | SI-SDR standard | SI-SDR challenging |
|---|---|---|---|---|
| TinyGRU+MCWF | 145.1K | 32.9M | 1.97 дБ | -1.16 дБ |
| TinyGRU-Large+MCWF | 432.4K | 68.77M | 2.75 дБ | -0.37 дБ |
| Полная cloud-boosted схема, 64 мс | 147.3K | 33.7M | 5.74 дБ | 2.33 дБ |
| Полная схема, 128 мс | 147.3K | 33.7M | 4.26 дБ | 1.07 дБ |
Как это читать: SI-SDR выше означает лучшее выделение целевой речи. Серверная подсказка и совместный фильтр Винера дают больше, чем грубое масштабирование локальной GRU, при этом добавляют мало локальных вычислений.