AVSR Uncertainty WER
Robust AVSR

UBG-Net: uncertainty-aware Bayesian fusion для robust AVSR

WER 3.9%

UBG-Net решает проблему audio-visual speech recognition в условиях, где надежность аудио и видео меняется от фрагмента к фрагменту: шум, overlapping speakers, silent face segments и segmentation errors. Вместо обычного deterministic fusion авторы явно разделяют aleatoric uncertainty входного сигнала и epistemic uncertainty модели, а затем используют Bayesian gating для слияния модальностей. Вторая практическая деталь - hierarchical voting по Monte Carlo samples, чтобы не усреднять несовместимые sequence hypotheses.

Метод. Основа - pretrained AV-HuBERT-style AVSR stack, поверх которого добавлены Modality Uncertainty-aware Bayesian Fusion (MUBF) и Distribution Uncertainty-aware Hierarchical Voting (DUHV). Aleatoric uncertainty оценивается из audio/visual features и подается как контекст в Bayesian layers, чтобы модель не путала шум сенсора с настоящей semantic ambiguity. На inference делается несколько MC forward passes; если несколько transcript variants совпадают, выбирается majority, а tie-breaking идет по decoding confidence.

Результаты. На simulated LRS2 средний WER у UBG-Net равен 3.9% против 4.1% у baseline, 33.8% у Whisper и 32.8% у Qwen3-Omni в этой AVSR постановке. При одном interfering speaker и -5 dB UBG-Net снижает WER с 6.4 до 5.2; при двух interfering speakers с 9.0 до 8.3. На реальном AVCocktail выигрыши скромнее, но устойчивые: active-speaker segmentation 21.9 против 22.6, fixed 10s chunks 36.1 против 39.2, gold segmentation 17.4 против 18.2 WER.

Ограничения. Улучшение относительно специализированного baseline невелико, особенно на LRS2, поэтому вклад скорее в robustness/fusion design, чем в резкий скачок качества. MC sampling и Bayesian layers добавляют inference cost, а статья не дает полноценного latency budget для real-time AVSR. Сравнение с general multimodal models вроде Whisper/Qwen3-Omni в этой задаче выглядит скорее sanity check: они плохо приспособлены к overlapped AVSR protocol.

Фишка из статьи. Абляция на AVCocktail хорошо показывает, что разные части uncertainty pipeline дают маленькие, но складывающиеся улучшения; особенно заметен fixed-chunk режим, где segmentation не помогает модели заранее.

МодельActive speaker WERFixed 10s WERGold WER
Baseline22.639.218.2
UBG-Net21.936.117.4
w/o epistemic22.337.817.9
w/o aleatoric22.137.617.7
w/o majority voting22.437.517.7
w/o confidence tie-break22.237.817.8

Как это читать: ни один компонент не делает чудо сам по себе, но fixed-chunk WER падает с 39.2 до 36.1. Это именно сценарий, где uncertainty-aware decoding полезен: модель должна выдержать плохую сегментацию и неоднозначные MC hypotheses.

Оригинальная статья на arXiv