Speech enhancement Adaptation Hearing aids
Speech enhancement

Contextual specialization в neural speech enhancement: что реально помогает

PESQ +1.10

Эта работа не предлагает еще одну enhancement architecture, а системно ранжирует, какая contextual information полезнее для specialization speech enhancement models. Это практично для hearing aids и on-device enhancement: маленькая модель может адаптироваться под текущего говорящего, noise type или язык, но не очевидно, какой контекст дает максимальный выигрыш. Главный вывод - speaker identity дает самый стабильный прирост, joint speaker-noise specialization лучше всего, а SNR, gender и noise type по отдельности дают более ограниченную пользу.

Метод. Авторы берут несколько SE architectures от tiny FFNN примерно на 10k parameters до medium models на 2-5M parameters: FFNN, LiSenNet, DCCRN, Conv-TasNet и TF-GridNet. Generalist модели обучаются на разнообразных speakers/noises, а specialists fine-tune или обучаются на подмножествах: конкретный speaker, gender, noise type, SNR или пара speaker+noise. Вторая часть проверяет language specialization: English-only specialist сравнивается с multilingual generalist на matched speakers/noise scenes.

Результаты. На Experiment 1 unprocessed mixture имеет SI-SDR -0.16 dB, PESQ 1.31 и ESTOI 0.551; таблицы показывают improvement относительно этой смеси. Для LiSenNet-S generalist дает +10.80 dB SI-SDR, +0.78 PESQ и +0.121 ESTOI, а LiSenNet-S Spk+Ns specialist дает +11.94 dB, +1.03 PESQ и +0.161 ESTOI. Для TF-GridNet generalist уже силен: +15.26 dB SI-SDR, +1.05 PESQ, +0.210 ESTOI, но joint specialist все равно повышает до +16.07 dB, +1.19 PESQ и +0.231 ESTOI.

Ограничения. Это upper-bound specialization setup с oracle contextual information: в реальном устройстве speaker/noise/language classifier тоже будет ошибаться и иметь latency. Test design использует seen-speaker/seen-acoustic-scene, additive noise и controlled SNR grid; это хорошо изолирует эффект specialization, но не доказывает robustness к reverberation, unseen rooms или overlapped speakers. Оценка объективная: SI-SDR, PESQ, ESTOI; субъективного listening test нет.

Фишка из статьи. Самая полезная инженерная деталь - маленький specialist может догнать или обойти generalist примерно на порядок больше. Это аргумент в пользу адаптивных наборов маленьких моделей, а не одной большой модели для всего.

АрхитектураРежим∆SI-SDR∆PESQ∆ESTOIКомментарий
LiSenNet-SGeneralist+10.80 dB+0.78+0.121small, около 100k params
LiSenNet-SSpk+Ns specialist+11.94 dB+1.03+0.161speaker+noise specialization
LiSenNet-MGeneralist+11.29 dB+0.87+0.136medium, около 1M params
LiSenNet-MSpk+Ns specialist+12.28 dB+1.10+0.173лучший вариант в этом семействе

Как это читать: LiSenNet-S specialist превосходит LiSenNet-M generalist по всем трем метрикам, хотя модель меньше. Основной смысл статьи не в абсолютном SOTA, а в ранжировании контекстов: speaker+noise specialization дает гораздо более надежный выигрыш, чем SNR или gender.

Оригинальная статья на arXiv