слуховые аппараты улучшение речи аудиовизуальные модели
arXiv eess.AS

AV-NeuroAMP: совместное аудиовизуальное обучение для слуховых аппаратов

arXiv:2610.08579

AV-NeuroAMP объединяет в одной модели подавление помех, персональную компенсацию потери слуха и динамическое сжатие диапазона. Существенная часть работы не в самом добавлении видеоканала, а в проверке на реальных слушателях: изображение губ особенно помогает там, где аудиосистема путает целевого говорящего с конкурирующей речью.

Метод. Модель получает шумную речь, видео лица целевого говорящего и аудиограмму слушателя. Аудиограмма управляет промежуточными признаками через AC-FiLM, а выход формируется сразу как усиленный сигнал, без отдельной цепочки «улучшение речи, затем слухопротезирование». Обучение ведётся по персональному эталону, рассчитанному из чистой речи и рецепта усиления; визуальная ветвь помогает выделять нужного говорящего.

Результаты. На английском тесте с шумом AV-NeuroAMP достигает HASPI 0,780 и HASQI 0,625 против 0,419 и 0,268 у аудиоверсии NeuroAMP; ошибка полосового усиления падает с 11,30 до 3,48 дБ, а целевой SNR растёт с -2,98 до 10,20 дБ. На невиданной мандаринской речи преимущество сохраняется: HASPI 0,598 против 0,449. У 12 участников с потерей слуха при конкурирующей речи нормированная разборчивость составила 0,264 против 0,167 у традиционной обработки и 0,027 у NeuroAMP.

Ограничения. Полноценное испытание охватывает 20 ушей и небольшое число акустических условий. Видеоканал требует видимого лица и синхронизации, а авторы пока не показывают носимую реализацию с контролируемой задержкой и энергопотреблением. Объективные эксперименты шире субъективных, но языковая переносимость проверена только на английском и мандаринском.

Фишка из статьи. Самый показательный результат возникает не на среднем шуме, а при конкурирующей речи: аудиосистема становится хуже традиционного слухового аппарата, тогда как видеоканал меняет знак результата.

СистемаКачество, 0–5Нормированная разборчивость
Традиционная обработка1,680,167
NeuroAMP, только звук1,370,027
AV-NeuroAMP, звук и видео2,050,264

Как это читать: выигрыш нельзя свести к более точному персональному усилению. При речевой помехе аудиомодель выбирает не тот источник, и усиление лишь закрепляет ошибку; зрительная привязка к губам возвращает целевого говорящего до этапа компенсации слуха.

Оригинальная статья на arXiv