Navigating Speech Enhancement for Real-Time MRI: A Systematic Assessment of Signal Quality, Source Preservation, and Downstream Tasks
Запись речи внутри МРТ забита мощным периодическим шумом, но «приятнее на слух» не обязательно значит «лучше для фонетики или распознавания». Эта работа не предлагает новый подавитель, а систематически проверяет три готовые системы на пяти корпусах и показывает, что улучшенный сигнал следует хранить как отдельную производную для конкретной задачи, а не как замену исходной записи.
Метод. Сравниваются причинный Denoiser, порождающий PASE и двунаправленный Mamba-подавитель RE-USE без донастройки на МРТ. Батарея включает четыре безопорных предсказателя качества, сходство голоса RawNet3, согласие распознанных фонем, STOI/ESTOI/PESQ на архивных парах, формантные и модуляционные признаки, три распознавателя, эмоции, возраст и связанные с говорящим задачи. Отдельная обработка чистой лабораторной речи показывает, какие изменения система вносит даже без шума.
Результаты. В 15 сочетаниях «корпус - распознаватель» на опубликованных DSP-входах RE-USE снижает точечную оценку WER в 11 случаях, а Denoiser повышает её в 13. На LSS Raw RE-USE снижает WER Qwen3 с 6,29% до 4,90%, тогда как Denoiser повышает до 10,02%, хотя безопорный UTMOS растёт у всех. В архивной аддитивной пробе RE-USE повышает STOI с 0,49 до 0,66, PESQ с 1,43 до 2,05 и сходство голоса с 0,45 до 0,54. Denoiser повышает STOI до 0,54, но обрушивает сходство голоса до 0,15.
Ограничения. Сырые записи доступны только для односпикерного LSS, а точный прежний DSP-конвейер восстановить нельзя. Архивная парная проба содержит лишь 370 фраз четырёх говорящих, причём код смешивания, источник шума и целевой SNR утрачены. Субъективного прослушивания нет; метрики голоса, фонем и качества являются прокси. Демографические срезы малы и спутаны с корпусом, возрастом и материалом, поэтому причинные выводы по группам делать нельзя.
Фишка из статьи. Одна компактная таблица показывает, почему безопорный показатель качества нельзя использовать как единственный критерий выбора подавителя: он награждает заметное преобразование, даже когда распознавание или личность говорящего страдают.
| Проба и метрика | Вход | Denoiser | PASE | RE-USE |
|---|---|---|---|---|
| LSS Raw: UTMOS | 1,28 | 1,59 | 3,51 | 3,73 |
| LSS Raw: WER Qwen3 | 6,29% | 10,02% | 6,60% | 4,90% |
| Аддитивный шум: сходство голоса | 0,45 | 0,15 | 0,45 | 0,54 |
| Аддитивный шум: STOI | 0,49 | 0,54 | 0,60 | 0,66 |
Как это читать: строки относятся к двум разным пробам и не сравниваются по абсолютной шкале между собой. Смысл в направлении изменений: Denoiser улучшает предсказанное качество и разборчивость, но может ухудшать распознавание и представление личности, тогда как RE-USE выглядит устойчивее, но тоже не побеждает во всех задачах.