аудиовизуальное распознавание речи устойчивость контрастное декодирование
arXiv cs.SD

Attention-Guided Reliability Scaling for Contrastive Decoding in Robust Audio-Visual Speech Recognition

arXiv:2608.26213

Работа предлагает способ аккуратно подключать изображение губ к распознаванию речи именно тогда, когда звуковой канал ненадёжен. Главный ход не требует дообучения: одна и та же модель дважды строит распределение следующего токена, по звуку с видео и только по звуку, а затем контраст между ними масштабируется по текущей надёжности звукового внимания.

Метод. Полная аудиовизуальная ветвь выступает «экспертом», а звуковая ветвь без видео — опорным вариантом. Коэффициент контрастного декодирования складывается из трёх сигналов: энергии внимания к звуку относительно скользящего среднего, энтропии этого внимания и нормированного расхождения Йенсена — Шеннона между двумя распределениями. Последний множитель имеет колоколообразное окно с центром 0,35 и шириной 0,15: слишком малое расхождение означает, что видео почти ничего не добавляет, а слишком большое может указывать на конфликт каналов.

Результаты. На 1327 фразах LRS3 с шумом MUSAN средняя относительная прибавка для Llama-AVSR 8B составляет 9,95%. При отношении сигнал/шум −15 дБ WER снижается с 37,23% до 33,69%, а на чистой речи — с 0,95% до 0,82%. На LRS2 без дополнительной настройки относительное улучшение равно 8,93%; для Omni-AVSR 1B и Qwen-AVSR 0.5B оно составляет 6,66% и 4,54%. Цена двойного прохода на A100 при размере пакета 1 — рост задержки с 1577,9 до 1714,3 мс, то есть на 8,6%.

Ограничения. Шум добавлен синтетически, видео остаётся чистым, а проверка проведена только на английских LRS2/LRS3. Параметры правила выбраны по отложенной части; потоковый режим, мобильное оборудование и ситуации с испорченным видео не исследованы. Кроме того, второй проход декодера остаётся заметной вычислительной платой даже без обучения.

Фишка из статьи. Постоянный коэффициент контраста не даёт одного лучшего режима: усиление видеоканала помогает в самом тяжёлом шуме, но начинает портить чистую и умеренно зашумлённую речь. Адаптивное правило почти сохраняет преимущество на −15 дБ и не платит за него качеством на лёгких условиях.

РежимЧисто, WER−5 дБ, WER−15 дБ, WER
Обычное декодирование0,95%9,45%37,23%
Постоянный λ = 0,20,90%8,96%32,39%
Постоянный λ = 0,41,14%10,11%31,50%
Адаптивный коэффициент0,82%8,66%33,69%

Как это читать: λ = 0,4 выигрывает у адаптивного режима только на предельном шуме, зато уже на −5 дБ даёт WER хуже исходной системы. Ценность механизма поэтому не в максимуме одной колонки, а в устойчивом компромиссе без выбора коэффициента под заранее известное отношение сигнал/шум.

Оригинальная статья на arXiv