Улучшение речи Постобработка ASR
arXiv eess.AS

Rethink-and-Refine: исправление чрезмерного подавления в улучшении речи

arXiv:2608.07781

Статья разбирает неприятный режим улучшения речи: модель убирает шум, но вместе с ним подавляет речевые признаки, что ухудшает распознавание и субъективное восприятие. Предложенный Rethink-and-Refine не требует дообучения исходного enhanser и работает на этапе вывода. Идея практичная: найти подозрительные интервалы через выравнивание речи и аккуратно смешать enhanced-сигнал с исходным noisy-сигналом.

Метод. Модуль берет noisy и enhanced audio, получает word- или phoneme-level alignment через модель распознавания речи и локализует участки, где улучшение ненадежно. Затем для этих сегментов применяется convex interpolation между исходным и улучшенным сигналом; веса подбираются по составной цели, где учитываются перцептивное качество и сохранение речи. Метод проверен поверх SEMamba, CMGAN и SGMSE.

Результаты. На URGENT 2025 для SEMamba PESQ растет с 1.535 до 1.546, STOI с 0.678 до 0.741, SCOREQ MOS с 2.044 до 2.221. На URGENT 2024 PESQ 1.941 -> 1.961, STOI 0.833 -> 0.859, SCOREQ 3.055 -> 3.168. Downstream-метрики показывают смысл коррекции: на URGENT 2025 WER enhanced-выхода 226.4%, после correction 99.4%; на MSP SNR-4 WER 38.9% -> 29.9%. В субъективном тесте URGENT24 средняя оценка enhanced 2.30, corrected 2.87.

Ограничения. Метод зависит от качества выравнивания и сам использует распознавание речи, поэтому ошибки ASR могут ошибочно локализовать проблемные интервалы. Эффективность и real-time режим оставлены на будущую работу. Коррекция может возвращать часть шума, а субъективная разметка имела modest agreement 54.77%, что ограничивает уверенность в listening test.

Фишка из статьи. Самая показательная таблица - downstream WER: обычное улучшение иногда хуже noisy-сигнала, а коррекция возвращает разборчивость.

СравнениеЧислоЧто означает
URGENT25 noisyWER 93.3%Шумный сигнал труден, но распознается лучше enhanced
URGENT25 enhancedWER 226.4%Over-suppression ломает речь сильнее шума
URGENT25 correctedWER 99.4%Часть речевых признаков восстановлена
MSP SNR-4 enhancedWER 38.9%Подавление тоже ухудшает downstream
MSP SNR-4 correctedWER 29.9%Коррекция снижает ошибку без обучения enhanser

Как это читать: это хороший пример, где метрика улучшения речи должна включать downstream ASR и speaker consistency, иначе можно оптимизировать приятный, но менее распознаваемый сигнал.

Оригинальная статья на arXiv