Attention-Guided Reliability Scaling for Contrastive Decoding in Robust Audio-Visual Speech Recognition
Работа предлагает способ аккуратно подключать изображение губ к распознаванию речи именно тогда, когда звуковой канал ненадёжен. Главный ход не требует дообучения: одна и та же модель дважды строит распределение следующего токена, по звуку с видео и только по звуку, а затем контраст между ними масштабируется по текущей надёжности звукового внимания.
Метод. Полная аудиовизуальная ветвь выступает «экспертом», а звуковая ветвь без видео — опорным вариантом. Коэффициент контрастного декодирования складывается из трёх сигналов: энергии внимания к звуку относительно скользящего среднего, энтропии этого внимания и нормированного расхождения Йенсена — Шеннона между двумя распределениями. Последний множитель имеет колоколообразное окно с центром 0,35 и шириной 0,15: слишком малое расхождение означает, что видео почти ничего не добавляет, а слишком большое может указывать на конфликт каналов.
Результаты. На 1327 фразах LRS3 с шумом MUSAN средняя относительная прибавка для Llama-AVSR 8B составляет 9,95%. При отношении сигнал/шум −15 дБ WER снижается с 37,23% до 33,69%, а на чистой речи — с 0,95% до 0,82%. На LRS2 без дополнительной настройки относительное улучшение равно 8,93%; для Omni-AVSR 1B и Qwen-AVSR 0.5B оно составляет 6,66% и 4,54%. Цена двойного прохода на A100 при размере пакета 1 — рост задержки с 1577,9 до 1714,3 мс, то есть на 8,6%.
Ограничения. Шум добавлен синтетически, видео остаётся чистым, а проверка проведена только на английских LRS2/LRS3. Параметры правила выбраны по отложенной части; потоковый режим, мобильное оборудование и ситуации с испорченным видео не исследованы. Кроме того, второй проход декодера остаётся заметной вычислительной платой даже без обучения.
Фишка из статьи. Постоянный коэффициент контраста не даёт одного лучшего режима: усиление видеоканала помогает в самом тяжёлом шуме, но начинает портить чистую и умеренно зашумлённую речь. Адаптивное правило почти сохраняет преимущество на −15 дБ и не платит за него качеством на лёгких условиях.
| Режим | Чисто, WER | −5 дБ, WER | −15 дБ, WER |
|---|---|---|---|
| Обычное декодирование | 0,95% | 9,45% | 37,23% |
| Постоянный λ = 0,2 | 0,90% | 8,96% | 32,39% |
| Постоянный λ = 0,4 | 1,14% | 10,11% | 31,50% |
| Адаптивный коэффициент | 0,82% | 8,66% | 33,69% |
Как это читать: λ = 0,4 выигрывает у адаптивного режима только на предельном шуме, зато уже на −5 дБ даёт WER хуже исходной системы. Ценность механизма поэтому не в максимуме одной колонки, а в устойчивом компромиссе без выбора коэффициента под заранее известное отношение сигнал/шум.