AVSR LLM Noise
AVSR robustness

VIB-AVSR: bottleneck в LLM снижает WER под шумом

WER -2.25 abs

VIB-AVSR добавляет Variational Information Bottleneck внутрь LLM-based audio-visual speech recognition и делает это с понятной мотивацией: визуальный поток помогает при шуме, но audio tokens всё равно несут noise-correlated признаки, которые LLM может переиспользовать. Bottleneck с KL-regularization заставляет промежуточные аудио-представления сохранить полезную речь и выбросить часть шумовой вариативности. В отличие от простой noise augmentation, эффект сохраняется и при clean training.

Метод

Базовая система — Llama-AVSR: audio encoder, video encoder, projection layers и LLM backbone с LoRA. VIB-модуль вставляется после выбранных LLM layers и моделирует скрытое audio representation как диагональное Gaussian posterior, регуляризованное к learnable Gaussian prior. Во время training bottleneck sample интерполируется с исходным hidden state, чтобы не разрушить всю информацию сразу.

Авторы тестируют single, dual и triple placements. Лучшей оказывается dual конфигурация после layers 4 и 8, а β нормируется на hidden dimension H. Отдельно проверяется коэффициент interpolation α: полная замена hidden state слишком агрессивна, фиксированное α=0.5 работает лучше schedule 0→0.5.

Результаты

  • При noisy training на babble noise average WER падает с 18.85 у Llama-AVSR до 17.39 у VIB-AVSR; на N>S условиях (-10/-5/-2 dB) с 26.84 до 24.59.
  • При clean training эффект больше: babble average WER 23.07→21.09, N>S 33.85→30.64.
  • На speech noise при clean training average WER снижается 16.20→15.05, N>S 23.78→21.83.
  • Clean/noise-free WER почти не страдает: noisy training 2.72→2.38, clean training 2.34→2.42.

Ограничения

Работа проверяет два synthetic noise типа и фиксированный AVSR backbone; реальные far-field, reverberation, lip occlusion и multi-speaker overlap остаются отдельными задачами. Модуль помогает устойчивости, но не решает проблему latency LLM-based ASR. Еще важно, что слишком сильная регуляризация β=1 резко ухудшает WER, поэтому bottleneck требует аккуратной настройки под backbone.

Фишка из статьи. В ablation видно, что robustness дает не просто “добавили bottleneck”, а конкретное место и сила сжатия. Dual insertion layers 4,8 и β=0.1/H дают лучший average WER, а полная замена hidden state ломает модель.

Настройка babbleAvg WERКомментарий
Single VIB after encoder (-1)15.03Лучший single bottleneck, но слабее dual.
Dual VIB 4,814.86Лучший placement: сжатие не слишком рано и не слишком поздно.
β=0.1/H14.86Оптимальная сила KL в таблице β.
β=1/H17.68Слишком жесткое сжатие удаляет полезную speech information.
α=019.54Полная замена hidden state sampled representation сильно вредит.

Как это читать: VIB стоит рассматривать как regularizer для noisy audio tokens, а не как универсальный denoiser. Он полезен, когда сохраняется residual path к исходному hidden state и bottleneck ставится в промежуточные LLM layers.

Оригинальная статья на arXiv