Hearing aids Whisper MOS
Speech metrics

HearAdvisor: Whisper-признаки предсказывают понятность речи в слуховых аппаратах

r=0.92

Эта работа интересна тем, что переносит оценку speech understanding из лабораторных intelligibility-тестов ближе к реальному рынку слуховых аппаратов. Авторы собирают крупный набор пользовательских оценок “насколько легко понять речь” для коммерческих устройств и учат метрику не на handcrafted auditory model, а на разности эмбеддингов frozen Whisper-small между обработанным сигналом и чистым reference. Получается intrusive speech-quality/intelligibility proxy, который лучше HASPIv2 совпадает с оценками людей на held-out devices.

Метод

Данные приходят из Blind Listening Challenge на HearAdvisor: пользователи с self-reported hearing loss сравнивают записи слуховых аппаратов в MUSHRA-подобном интерфейсе и ставят оценку по пятибалльной шкале Ease of Understanding. Записи сделаны через KEMAR acoustic manikin, для одного стандартного N3 audiogram, в 72 сценах: 12 background environments умножаются на 6 talker configurations.

Модель устроена просто и прагматично. Aided audio и matched clean speech подаются в один и тот же frozen Whisper-small encoder. Для каждого сигнала mean-pooled hidden states превращаются в 768-мерный вектор, затем авторы вычитают clean embedding из aided embedding, чтобы модель видела не содержание фразы, а трансформацию, внесенную устройством. Поверх этого стоит небольшой MLP head 768→768→384→1; Whisper не дообучается. Для quiet scenes используется слой 2, для loud scenes — слой 5, то есть авторы явно разводят разные акустические режимы.

Результаты

  • После quality screening осталось 104 298 ratings из 151 608, 10 394 binaural recordings, 83 commercial products и 1 764 talker-pooled scene-level targets.
  • На held-out devices correlation на scene level: learned metric r=0.92 против 0.83 у HASPIv2 overall.
  • В noisy/loud scenes разрыв r=0.89 против 0.75, в quiet scenes r=0.79 против 0.58.
  • В loud scenes модель фактически доходит до split-half reliability потолка, то есть предсказывает среднюю оценку примерно настолько хорошо, насколько две независимые группы слушателей согласуются между собой.

Важно, что это не просто еще одна “speech foundation model as feature extractor” работа. Целевая переменная здесь не объективная разборчивость предложения, а perceived benefit: пользователю легче или тяжелее понять речь в записи конкретного коммерческого аппарата.

Ограничения

Метрика reference-based: ей нужен clean speech, поэтому она не является no-reference production monitor для любого пользовательского аудио. Все записи привязаны к одному N3 audiogram и KEMAR setup, а data collection идет через веб с self-selected пользователями, разным playback hardware и грубой calibration. Еще одно ограничение — coverage acoustic scenes: 12 backgrounds полезны, но это не полное пространство реальных комнат, шумов и посадок микрофонов.

Фишка из статьи. Самое полезное здесь — не сам факт, что Whisper помогает, а масштаб и способ постановки задачи: авторы учат маленький head на разности clean/aided эмбеддингов и получают метрику, которая выигрывает у HASPIv2 именно на пользовательской Ease of Understanding, а не на лабораторной intelligibility.

УровеньДанные/метрикаЧто это показывает
Dataset104 298 screened ratings, 10 394 recordings, 83 productsМодель учится на реальных коммерческих устройствах, а не только на синтетических distortions.
Overall scene-levelr=0.92 vs 0.83 у HASPIv2Whisper-difference embedding лучше совпадает с consumer-rated ease of understanding.
Loud scenesr=0.89 vs 0.75В шумных сценах модель почти упирается в надежность самих человеческих оценок.
Quiet scenesr=0.79 vs 0.58Даже там, где ограничителем может быть audibility, learned metric заметно стабильнее HASPIv2.

Как это читать: для speech/audio pipeline это пример того, как ASR encoder можно использовать не для распознавания, а как perceptual feature extractor. Но переносить результат на произвольные слуховые профили и no-reference мониторинг пока нельзя: статья честно остается внутри controlled manikin/reference setup.

Оригинальная статья на arXiv