AV-NeuroAMP: совместное аудиовизуальное обучение для слуховых аппаратов
AV-NeuroAMP объединяет в одной модели подавление помех, персональную компенсацию потери слуха и динамическое сжатие диапазона. Существенная часть работы не в самом добавлении видеоканала, а в проверке на реальных слушателях: изображение губ особенно помогает там, где аудиосистема путает целевого говорящего с конкурирующей речью.
Метод. Модель получает шумную речь, видео лица целевого говорящего и аудиограмму слушателя. Аудиограмма управляет промежуточными признаками через AC-FiLM, а выход формируется сразу как усиленный сигнал, без отдельной цепочки «улучшение речи, затем слухопротезирование». Обучение ведётся по персональному эталону, рассчитанному из чистой речи и рецепта усиления; визуальная ветвь помогает выделять нужного говорящего.
Результаты. На английском тесте с шумом AV-NeuroAMP достигает HASPI 0,780 и HASQI 0,625 против 0,419 и 0,268 у аудиоверсии NeuroAMP; ошибка полосового усиления падает с 11,30 до 3,48 дБ, а целевой SNR растёт с -2,98 до 10,20 дБ. На невиданной мандаринской речи преимущество сохраняется: HASPI 0,598 против 0,449. У 12 участников с потерей слуха при конкурирующей речи нормированная разборчивость составила 0,264 против 0,167 у традиционной обработки и 0,027 у NeuroAMP.
Ограничения. Полноценное испытание охватывает 20 ушей и небольшое число акустических условий. Видеоканал требует видимого лица и синхронизации, а авторы пока не показывают носимую реализацию с контролируемой задержкой и энергопотреблением. Объективные эксперименты шире субъективных, но языковая переносимость проверена только на английском и мандаринском.
Фишка из статьи. Самый показательный результат возникает не на среднем шуме, а при конкурирующей речи: аудиосистема становится хуже традиционного слухового аппарата, тогда как видеоканал меняет знак результата.
| Система | Качество, 0–5 | Нормированная разборчивость |
|---|---|---|
| Традиционная обработка | 1,68 | 0,167 |
| NeuroAMP, только звук | 1,37 | 0,027 |
| AV-NeuroAMP, звук и видео | 2,05 | 0,264 |
Как это читать: выигрыш нельзя свести к более точному персональному усилению. При речевой помехе аудиомодель выбирает не тот источник, и усиление лишь закрепляет ошибку; зрительная привязка к губам возвращает целевого говорящего до этапа компенсации слуха.