Когда улучшение речи мешает распознаванию: диагностика STFT-маски
Статья разбирает практический сбой в связке «улучшение речи - распознавание речи»: модель может заметно поднять PESQ, STOI и SI-SDR, но не помочь распознавателю или даже ухудшить WER. Авторы не ограничиваются объяснением через «артефакты», а вводят полярную проекцию STFT-маски: отдельно управляют силой амплитудной коррекции и фазовой поправкой. Главный результат полезен для инженерной настройки: для распознавания рабочей ручкой оказывается амплитуда, а оцененная фазовая коррекция в этих экспериментах пользы не дала.
Метод. Для комплексной маски M = A e^{jφ} авторы строят M_{α,γ} = A^α e^{jγφ}. Параметр α ослабляет или усиливает амплитудное подавление шума, а γ включает долю фазовой коррекции; при α=0, γ=0 получается исходный шумный сигнал, при α=1, γ=1 - полная маска улучшителя. Это делается только на выводе, без переобучения улучшителя или распознавателя. Основной анализ проведен на VoiceBank+DEMAND с 1648 тестовыми фразами на восьми SNR от -7.5 до 17.5 dB, для FRCRN-SE и MossFormerGAN-SE, с двумя разными распознавателями: Whisper-large-v3 и wav2vec 2.0.
Результаты. Уже базовая таблица показывает конфликт: FRCRN-SE повышает SI-SDR до 16.6, PESQ до 2.73 и STOI до 0.93, но средний WER Whisper остается 6.7% против 6.6% на шумном входе. MossFormerGAN-SE лучше согласован с распознаванием: при SI-SDR 17.5 и PESQ 2.95 он снижает средний WER до 6.0%. В полярной проекции для FRCRN-SE оптимальная амплитудная сила различается по распознавателю: wav2vec 2.0 получает минимум WER 10.20% при α=0.85, а Whisper - 5.57% при намного более мягком α=0.25. Фазовая ось ведет себя проще: рост γ не улучшает WER и при оптимальном α статистически ухудшает распознавание.
Ограничения. Это сильная диагностическая работа, но не универсальное решение улучшения речи для распознавания. Оптимальное α зависит от распознавателя, улучшителя, шума и домена; проверка сделана на одном стандартном корпусе без реверберации в добавленных низких SNR. Вывод про фазу надо читать аккуратно: он относится к оцененным фазовым поправкам конкретных улучшителей, а не доказывает, что фазовая информация вообще бесполезна для распознавания.
Фишка из статьи. Самый содержательный кусок - таблица SNR-wise penalty: авторы превращают расплывчатое «переусиление/переподавление» в измеримый WER-gap между оптимальной маской и двумя крайностями.
| SNR | wav2vec 2.0: α* | Цена недоподавления | Whisper: α* | Цена переподавления |
|---|---|---|---|---|
| -7.5 dB | 0.85 | +17.7 WER п.п. | 0.15 | +4.2 WER п.п. |
| -5.0 dB | 0.70 | +14.3 WER п.п. | 0.40 | +2.1 WER п.п. |
| 0.0 dB | 0.65 | +8.1 WER п.п. | 0.30 | +0.8 WER п.п. |
| 17.5 dB | 0.45 | +0.4 WER п.п. | 0.00 | +0.2 WER п.п. |
Как это читать: wav2vec 2.0 на низких SNR страдает прежде всего от слишком слабого подавления шума, поэтому ему нужна почти полная амплитудная маска. Whisper уже устойчив к шуму и чаще теряет слабые речевые признаки от полного подавления, поэтому ему нужна мягкая коррекция или даже почти исходная амплитуда на высоком SNR.