Contextual specialization в neural speech enhancement: что реально помогает
Эта работа не предлагает еще одну enhancement architecture, а системно ранжирует, какая contextual information полезнее для specialization speech enhancement models. Это практично для hearing aids и on-device enhancement: маленькая модель может адаптироваться под текущего говорящего, noise type или язык, но не очевидно, какой контекст дает максимальный выигрыш. Главный вывод - speaker identity дает самый стабильный прирост, joint speaker-noise specialization лучше всего, а SNR, gender и noise type по отдельности дают более ограниченную пользу.
Метод. Авторы берут несколько SE architectures от tiny FFNN примерно на 10k parameters до medium models на 2-5M parameters: FFNN, LiSenNet, DCCRN, Conv-TasNet и TF-GridNet. Generalist модели обучаются на разнообразных speakers/noises, а specialists fine-tune или обучаются на подмножествах: конкретный speaker, gender, noise type, SNR или пара speaker+noise. Вторая часть проверяет language specialization: English-only specialist сравнивается с multilingual generalist на matched speakers/noise scenes.
Результаты. На Experiment 1 unprocessed mixture имеет SI-SDR -0.16 dB, PESQ 1.31 и ESTOI 0.551; таблицы показывают improvement относительно этой смеси. Для LiSenNet-S generalist дает +10.80 dB SI-SDR, +0.78 PESQ и +0.121 ESTOI, а LiSenNet-S Spk+Ns specialist дает +11.94 dB, +1.03 PESQ и +0.161 ESTOI. Для TF-GridNet generalist уже силен: +15.26 dB SI-SDR, +1.05 PESQ, +0.210 ESTOI, но joint specialist все равно повышает до +16.07 dB, +1.19 PESQ и +0.231 ESTOI.
Ограничения. Это upper-bound specialization setup с oracle contextual information: в реальном устройстве speaker/noise/language classifier тоже будет ошибаться и иметь latency. Test design использует seen-speaker/seen-acoustic-scene, additive noise и controlled SNR grid; это хорошо изолирует эффект specialization, но не доказывает robustness к reverberation, unseen rooms или overlapped speakers. Оценка объективная: SI-SDR, PESQ, ESTOI; субъективного listening test нет.
Фишка из статьи. Самая полезная инженерная деталь - маленький specialist может догнать или обойти generalist примерно на порядок больше. Это аргумент в пользу адаптивных наборов маленьких моделей, а не одной большой модели для всего.
| Архитектура | Режим | ∆SI-SDR | ∆PESQ | ∆ESTOI | Комментарий |
|---|---|---|---|---|---|
| LiSenNet-S | Generalist | +10.80 dB | +0.78 | +0.121 | small, около 100k params |
| LiSenNet-S | Spk+Ns specialist | +11.94 dB | +1.03 | +0.161 | speaker+noise specialization |
| LiSenNet-M | Generalist | +11.29 dB | +0.87 | +0.136 | medium, около 1M params |
| LiSenNet-M | Spk+Ns specialist | +12.28 dB | +1.10 | +0.173 | лучший вариант в этом семействе |
Как это читать: LiSenNet-S specialist превосходит LiSenNet-M generalist по всем трем метрикам, хотя модель меньше. Основной смысл статьи не в абсолютном SOTA, а в ранжировании контекстов: speaker+noise specialization дает гораздо более надежный выигрыш, чем SNR или gender.