улучшение речи фаза потоковая обработка
arXiv eess.AS

Towards Balanced Spectral Reconstruction: Spectrally Adaptive Loss for Streaming Speech Enhancement

arXiv:2608.30739

Работа нацелена на тихие высокочастотные компоненты, которые обычная спектральная ошибка легко отдаёт в жертву сильным низким частотам. Адаптивная фазочувствительная функция потерь перераспределяет вес по частотно-временным ячейкам и улучшает локальную реконструкцию, сохраняя потоковую обработку с задержкой 32 мс.

Метод. HyST-Net сочетает спектральное многоголовое внимание и временные GRU и оценивает комплексную STFT. Авторы сравнивают фиксированное сигмоидальное взвешивание LSig и LAdp, где вес зависит от чистого логарифмического модуля в конкретной ячейке; обе функции учитывают модуль и фазу. Обучение проводится на 140 часах синтетических смесей DNS Challenge с SNR от −5 до 20 дБ.

Результаты. HyST-Net содержит 0,11 млн параметров, требует 266,4 млн MAC/с и на одном потоке Xeon имеет RTF 0,22; у FTF-Net — 0,14 млн, 318,2 млн MAC/с и RTF 1,05. По общим показателям адаптивная потеря почти не меняет результат: PESQ 2,86 → 2,85, ESTOI 0,914 → 0,914, SI-SDR 17,41 → 17,33 дБ. Зато в высокочастотной области комплексная ошибка снижается примерно на 9,9%, ошибка модуля — на 15,6%, LSD — на 1,18 дБ.

Ограничения. Проверка ограничена синтетическим тестом DNS и объективными показателями; прослушивания, реальных комнат и других языков нет. Адаптивные веса вычисляются по чистому сигналу и доступны только при обучении. Результат показан на одной компактной архитектуре, а общие метрики практически не улучшаются, поэтому слышимость локального выигрыша ещё требует подтверждения.

Фишка из статьи. Средние показатели почти плоские, хотя ошибки в слабой высокочастотной полосе заметно уменьшаются. Это редкий полезный отрицательный результат: глобальная PESQ не показывает, куда именно модель перераспределила качество.

ПоказательОбычная смешанная потеряАдаптивная LAdp
Общая PESQ2,862,85
Общая ESTOI0,9140,914
Общая SI-SDR17,41 дБ17,33 дБ
Высокочастотная C-RMSE0,02730,0246
Высокочастотная M-RMSE0,02370,0200
Высокочастотная LSD8,67 дБ7,49 дБ
Высокочастотная SI-SDR13,92 дБ14,35 дБ

Как это читать: первые три строки усредняют весь спектр и почти не различают варианты; нижние четыре изолируют полосу, ради которой введено взвешивание. Метод улучшает баланс спектра, но пока не доказано, что это даёт слышимый средний выигрыш.

Оригинальная статья на arXiv