Улучшение речи Акустика МРТ Оценка качества
arXiv eess.AS

Navigating Speech Enhancement for Real-Time MRI: A Systematic Assessment of Signal Quality, Source Preservation, and Downstream Tasks

arXiv:2608.16125

Запись речи внутри МРТ забита мощным периодическим шумом, но «приятнее на слух» не обязательно значит «лучше для фонетики или распознавания». Эта работа не предлагает новый подавитель, а систематически проверяет три готовые системы на пяти корпусах и показывает, что улучшенный сигнал следует хранить как отдельную производную для конкретной задачи, а не как замену исходной записи.

Метод. Сравниваются причинный Denoiser, порождающий PASE и двунаправленный Mamba-подавитель RE-USE без донастройки на МРТ. Батарея включает четыре безопорных предсказателя качества, сходство голоса RawNet3, согласие распознанных фонем, STOI/ESTOI/PESQ на архивных парах, формантные и модуляционные признаки, три распознавателя, эмоции, возраст и связанные с говорящим задачи. Отдельная обработка чистой лабораторной речи показывает, какие изменения система вносит даже без шума.

Результаты. В 15 сочетаниях «корпус - распознаватель» на опубликованных DSP-входах RE-USE снижает точечную оценку WER в 11 случаях, а Denoiser повышает её в 13. На LSS Raw RE-USE снижает WER Qwen3 с 6,29% до 4,90%, тогда как Denoiser повышает до 10,02%, хотя безопорный UTMOS растёт у всех. В архивной аддитивной пробе RE-USE повышает STOI с 0,49 до 0,66, PESQ с 1,43 до 2,05 и сходство голоса с 0,45 до 0,54. Denoiser повышает STOI до 0,54, но обрушивает сходство голоса до 0,15.

Ограничения. Сырые записи доступны только для односпикерного LSS, а точный прежний DSP-конвейер восстановить нельзя. Архивная парная проба содержит лишь 370 фраз четырёх говорящих, причём код смешивания, источник шума и целевой SNR утрачены. Субъективного прослушивания нет; метрики голоса, фонем и качества являются прокси. Демографические срезы малы и спутаны с корпусом, возрастом и материалом, поэтому причинные выводы по группам делать нельзя.

Фишка из статьи. Одна компактная таблица показывает, почему безопорный показатель качества нельзя использовать как единственный критерий выбора подавителя: он награждает заметное преобразование, даже когда распознавание или личность говорящего страдают.

Проба и метрикаВходDenoiserPASERE-USE
LSS Raw: UTMOS1,281,593,513,73
LSS Raw: WER Qwen36,29%10,02%6,60%4,90%
Аддитивный шум: сходство голоса0,450,150,450,54
Аддитивный шум: STOI0,490,540,600,66

Как это читать: строки относятся к двум разным пробам и не сравниваются по абсолютной шкале между собой. Смысл в направлении изменений: Denoiser улучшает предсказанное качество и разборчивость, но может ухудшать распознавание и представление личности, тогда как RE-USE выглядит устойчивее, но тоже не побеждает во всех задачах.

Оригинальная статья на arXiv