Towards Balanced Spectral Reconstruction: Spectrally Adaptive Loss for Streaming Speech Enhancement
Работа нацелена на тихие высокочастотные компоненты, которые обычная спектральная ошибка легко отдаёт в жертву сильным низким частотам. Адаптивная фазочувствительная функция потерь перераспределяет вес по частотно-временным ячейкам и улучшает локальную реконструкцию, сохраняя потоковую обработку с задержкой 32 мс.
Метод. HyST-Net сочетает спектральное многоголовое внимание и временные GRU и оценивает комплексную STFT. Авторы сравнивают фиксированное сигмоидальное взвешивание LSig и LAdp, где вес зависит от чистого логарифмического модуля в конкретной ячейке; обе функции учитывают модуль и фазу. Обучение проводится на 140 часах синтетических смесей DNS Challenge с SNR от −5 до 20 дБ.
Результаты. HyST-Net содержит 0,11 млн параметров, требует 266,4 млн MAC/с и на одном потоке Xeon имеет RTF 0,22; у FTF-Net — 0,14 млн, 318,2 млн MAC/с и RTF 1,05. По общим показателям адаптивная потеря почти не меняет результат: PESQ 2,86 → 2,85, ESTOI 0,914 → 0,914, SI-SDR 17,41 → 17,33 дБ. Зато в высокочастотной области комплексная ошибка снижается примерно на 9,9%, ошибка модуля — на 15,6%, LSD — на 1,18 дБ.
Ограничения. Проверка ограничена синтетическим тестом DNS и объективными показателями; прослушивания, реальных комнат и других языков нет. Адаптивные веса вычисляются по чистому сигналу и доступны только при обучении. Результат показан на одной компактной архитектуре, а общие метрики практически не улучшаются, поэтому слышимость локального выигрыша ещё требует подтверждения.
Фишка из статьи. Средние показатели почти плоские, хотя ошибки в слабой высокочастотной полосе заметно уменьшаются. Это редкий полезный отрицательный результат: глобальная PESQ не показывает, куда именно модель перераспределила качество.
| Показатель | Обычная смешанная потеря | Адаптивная LAdp |
|---|---|---|
| Общая PESQ | 2,86 | 2,85 |
| Общая ESTOI | 0,914 | 0,914 |
| Общая SI-SDR | 17,41 дБ | 17,33 дБ |
| Высокочастотная C-RMSE | 0,0273 | 0,0246 |
| Высокочастотная M-RMSE | 0,0237 | 0,0200 |
| Высокочастотная LSD | 8,67 дБ | 7,49 дБ |
| Высокочастотная SI-SDR | 13,92 дБ | 14,35 дБ |
Как это читать: первые три строки усредняют весь спектр и почти не различают варианты; нижние четыре изолируют полосу, ради которой введено взвешивание. Метод улучшает баланс спектра, но пока не доказано, что это даёт слышимый средний выигрыш.