Rethink-and-Refine: исправление чрезмерного подавления в улучшении речи
Статья разбирает неприятный режим улучшения речи: модель убирает шум, но вместе с ним подавляет речевые признаки, что ухудшает распознавание и субъективное восприятие. Предложенный Rethink-and-Refine не требует дообучения исходного enhanser и работает на этапе вывода. Идея практичная: найти подозрительные интервалы через выравнивание речи и аккуратно смешать enhanced-сигнал с исходным noisy-сигналом.
Метод. Модуль берет noisy и enhanced audio, получает word- или phoneme-level alignment через модель распознавания речи и локализует участки, где улучшение ненадежно. Затем для этих сегментов применяется convex interpolation между исходным и улучшенным сигналом; веса подбираются по составной цели, где учитываются перцептивное качество и сохранение речи. Метод проверен поверх SEMamba, CMGAN и SGMSE.
Результаты. На URGENT 2025 для SEMamba PESQ растет с 1.535 до 1.546, STOI с 0.678 до 0.741, SCOREQ MOS с 2.044 до 2.221. На URGENT 2024 PESQ 1.941 -> 1.961, STOI 0.833 -> 0.859, SCOREQ 3.055 -> 3.168. Downstream-метрики показывают смысл коррекции: на URGENT 2025 WER enhanced-выхода 226.4%, после correction 99.4%; на MSP SNR-4 WER 38.9% -> 29.9%. В субъективном тесте URGENT24 средняя оценка enhanced 2.30, corrected 2.87.
Ограничения. Метод зависит от качества выравнивания и сам использует распознавание речи, поэтому ошибки ASR могут ошибочно локализовать проблемные интервалы. Эффективность и real-time режим оставлены на будущую работу. Коррекция может возвращать часть шума, а субъективная разметка имела modest agreement 54.77%, что ограничивает уверенность в listening test.
Фишка из статьи. Самая показательная таблица - downstream WER: обычное улучшение иногда хуже noisy-сигнала, а коррекция возвращает разборчивость.
| Сравнение | Число | Что означает |
|---|---|---|
| URGENT25 noisy | WER 93.3% | Шумный сигнал труден, но распознается лучше enhanced |
| URGENT25 enhanced | WER 226.4% | Over-suppression ломает речь сильнее шума |
| URGENT25 corrected | WER 99.4% | Часть речевых признаков восстановлена |
| MSP SNR-4 enhanced | WER 38.9% | Подавление тоже ухудшает downstream |
| MSP SNR-4 corrected | WER 29.9% | Коррекция снижает ошибку без обучения enhanser |
Как это читать: это хороший пример, где метрика улучшения речи должна включать downstream ASR и speaker consistency, иначе можно оптимизировать приятный, но менее распознаваемый сигнал.