Улучшение речи Распознавание речи STFT
Улучшение речи

Когда улучшение речи мешает распознаванию: диагностика STFT-маски

WER 5.57%

Статья разбирает практический сбой в связке «улучшение речи - распознавание речи»: модель может заметно поднять PESQ, STOI и SI-SDR, но не помочь распознавателю или даже ухудшить WER. Авторы не ограничиваются объяснением через «артефакты», а вводят полярную проекцию STFT-маски: отдельно управляют силой амплитудной коррекции и фазовой поправкой. Главный результат полезен для инженерной настройки: для распознавания рабочей ручкой оказывается амплитуда, а оцененная фазовая коррекция в этих экспериментах пользы не дала.

Метод. Для комплексной маски M = A e^{jφ} авторы строят M_{α,γ} = A^α e^{jγφ}. Параметр α ослабляет или усиливает амплитудное подавление шума, а γ включает долю фазовой коррекции; при α=0, γ=0 получается исходный шумный сигнал, при α=1, γ=1 - полная маска улучшителя. Это делается только на выводе, без переобучения улучшителя или распознавателя. Основной анализ проведен на VoiceBank+DEMAND с 1648 тестовыми фразами на восьми SNR от -7.5 до 17.5 dB, для FRCRN-SE и MossFormerGAN-SE, с двумя разными распознавателями: Whisper-large-v3 и wav2vec 2.0.

Результаты. Уже базовая таблица показывает конфликт: FRCRN-SE повышает SI-SDR до 16.6, PESQ до 2.73 и STOI до 0.93, но средний WER Whisper остается 6.7% против 6.6% на шумном входе. MossFormerGAN-SE лучше согласован с распознаванием: при SI-SDR 17.5 и PESQ 2.95 он снижает средний WER до 6.0%. В полярной проекции для FRCRN-SE оптимальная амплитудная сила различается по распознавателю: wav2vec 2.0 получает минимум WER 10.20% при α=0.85, а Whisper - 5.57% при намного более мягком α=0.25. Фазовая ось ведет себя проще: рост γ не улучшает WER и при оптимальном α статистически ухудшает распознавание.

Ограничения. Это сильная диагностическая работа, но не универсальное решение улучшения речи для распознавания. Оптимальное α зависит от распознавателя, улучшителя, шума и домена; проверка сделана на одном стандартном корпусе без реверберации в добавленных низких SNR. Вывод про фазу надо читать аккуратно: он относится к оцененным фазовым поправкам конкретных улучшителей, а не доказывает, что фазовая информация вообще бесполезна для распознавания.

Фишка из статьи. Самый содержательный кусок - таблица SNR-wise penalty: авторы превращают расплывчатое «переусиление/переподавление» в измеримый WER-gap между оптимальной маской и двумя крайностями.

SNRwav2vec 2.0: α*Цена недоподавленияWhisper: α*Цена переподавления
-7.5 dB0.85+17.7 WER п.п.0.15+4.2 WER п.п.
-5.0 dB0.70+14.3 WER п.п.0.40+2.1 WER п.п.
0.0 dB0.65+8.1 WER п.п.0.30+0.8 WER п.п.
17.5 dB0.45+0.4 WER п.п.0.00+0.2 WER п.п.

Как это читать: wav2vec 2.0 на низких SNR страдает прежде всего от слишком слабого подавления шума, поэтому ему нужна почти полная амплитудная маска. Whisper уже устойчив к шуму и чаще теряет слабые речевые признаки от полного подавления, поэтому ему нужна мягкая коррекция или даже почти исходная амплитуда на высоком SNR.

Оригинальная статья на arXiv