VIB-AVSR: bottleneck в LLM снижает WER под шумом
VIB-AVSR добавляет Variational Information Bottleneck внутрь LLM-based audio-visual speech recognition и делает это с понятной мотивацией: визуальный поток помогает при шуме, но audio tokens всё равно несут noise-correlated признаки, которые LLM может переиспользовать. Bottleneck с KL-regularization заставляет промежуточные аудио-представления сохранить полезную речь и выбросить часть шумовой вариативности. В отличие от простой noise augmentation, эффект сохраняется и при clean training.
Метод
Базовая система — Llama-AVSR: audio encoder, video encoder, projection layers и LLM backbone с LoRA. VIB-модуль вставляется после выбранных LLM layers и моделирует скрытое audio representation как диагональное Gaussian posterior, регуляризованное к learnable Gaussian prior. Во время training bottleneck sample интерполируется с исходным hidden state, чтобы не разрушить всю информацию сразу.
Авторы тестируют single, dual и triple placements. Лучшей оказывается dual конфигурация после layers 4 и 8, а β нормируется на hidden dimension H. Отдельно проверяется коэффициент interpolation α: полная замена hidden state слишком агрессивна, фиксированное α=0.5 работает лучше schedule 0→0.5.
Результаты
- При noisy training на babble noise average WER падает с 18.85 у Llama-AVSR до 17.39 у VIB-AVSR; на N>S условиях (-10/-5/-2 dB) с 26.84 до 24.59.
- При clean training эффект больше: babble average WER 23.07→21.09, N>S 33.85→30.64.
- На speech noise при clean training average WER снижается 16.20→15.05, N>S 23.78→21.83.
- Clean/noise-free WER почти не страдает: noisy training 2.72→2.38, clean training 2.34→2.42.
Ограничения
Работа проверяет два synthetic noise типа и фиксированный AVSR backbone; реальные far-field, reverberation, lip occlusion и multi-speaker overlap остаются отдельными задачами. Модуль помогает устойчивости, но не решает проблему latency LLM-based ASR. Еще важно, что слишком сильная регуляризация β=1 резко ухудшает WER, поэтому bottleneck требует аккуратной настройки под backbone.
Фишка из статьи. В ablation видно, что robustness дает не просто “добавили bottleneck”, а конкретное место и сила сжатия. Dual insertion layers 4,8 и β=0.1/H дают лучший average WER, а полная замена hidden state ломает модель.
| Настройка babble | Avg WER | Комментарий |
|---|---|---|
| Single VIB after encoder (-1) | 15.03 | Лучший single bottleneck, но слабее dual. |
| Dual VIB 4,8 | 14.86 | Лучший placement: сжатие не слишком рано и не слишком поздно. |
| β=0.1/H | 14.86 | Оптимальная сила KL в таблице β. |
| β=1/H | 17.68 | Слишком жесткое сжатие удаляет полезную speech information. |
| α=0 | 19.54 | Полная замена hidden state sampled representation сильно вредит. |
Как это читать: VIB стоит рассматривать как regularizer для noisy audio tokens, а не как универсальный denoiser. Он полезен, когда сохраняется residual path к исходному hidden state и bottleneck ставится в промежуточные LLM layers.