UBG-Net: uncertainty-aware Bayesian fusion для robust AVSR
UBG-Net решает проблему audio-visual speech recognition в условиях, где надежность аудио и видео меняется от фрагмента к фрагменту: шум, overlapping speakers, silent face segments и segmentation errors. Вместо обычного deterministic fusion авторы явно разделяют aleatoric uncertainty входного сигнала и epistemic uncertainty модели, а затем используют Bayesian gating для слияния модальностей. Вторая практическая деталь - hierarchical voting по Monte Carlo samples, чтобы не усреднять несовместимые sequence hypotheses.
Метод. Основа - pretrained AV-HuBERT-style AVSR stack, поверх которого добавлены Modality Uncertainty-aware Bayesian Fusion (MUBF) и Distribution Uncertainty-aware Hierarchical Voting (DUHV). Aleatoric uncertainty оценивается из audio/visual features и подается как контекст в Bayesian layers, чтобы модель не путала шум сенсора с настоящей semantic ambiguity. На inference делается несколько MC forward passes; если несколько transcript variants совпадают, выбирается majority, а tie-breaking идет по decoding confidence.
Результаты. На simulated LRS2 средний WER у UBG-Net равен 3.9% против 4.1% у baseline, 33.8% у Whisper и 32.8% у Qwen3-Omni в этой AVSR постановке. При одном interfering speaker и -5 dB UBG-Net снижает WER с 6.4 до 5.2; при двух interfering speakers с 9.0 до 8.3. На реальном AVCocktail выигрыши скромнее, но устойчивые: active-speaker segmentation 21.9 против 22.6, fixed 10s chunks 36.1 против 39.2, gold segmentation 17.4 против 18.2 WER.
Ограничения. Улучшение относительно специализированного baseline невелико, особенно на LRS2, поэтому вклад скорее в robustness/fusion design, чем в резкий скачок качества. MC sampling и Bayesian layers добавляют inference cost, а статья не дает полноценного latency budget для real-time AVSR. Сравнение с general multimodal models вроде Whisper/Qwen3-Omni в этой задаче выглядит скорее sanity check: они плохо приспособлены к overlapped AVSR protocol.
Фишка из статьи. Абляция на AVCocktail хорошо показывает, что разные части uncertainty pipeline дают маленькие, но складывающиеся улучшения; особенно заметен fixed-chunk режим, где segmentation не помогает модели заранее.
| Модель | Active speaker WER | Fixed 10s WER | Gold WER |
|---|---|---|---|
| Baseline | 22.6 | 39.2 | 18.2 |
| UBG-Net | 21.9 | 36.1 | 17.4 |
| w/o epistemic | 22.3 | 37.8 | 17.9 |
| w/o aleatoric | 22.1 | 37.6 | 17.7 |
| w/o majority voting | 22.4 | 37.5 | 17.7 |
| w/o confidence tie-break | 22.2 | 37.8 | 17.8 |
Как это читать: ни один компонент не делает чудо сам по себе, но fixed-chunk WER падает с 39.2 до 36.1. Это именно сценарий, где uncertainty-aware decoding полезен: модель должна выдержать плохую сегментацию и неоднозначные MC hypotheses.