AVSR Шумоустойчивость LLM
Аудиовизуальное распознавание

DoubleHelix: итеративное слияние аудио и артикуляции для AVSR

WER 0.68%

DoubleHelix рассматривает аудиовизуальное распознавание речи как задачу не разового объединения признаков, а последовательного уточнения между звуком и изображением губ. Это важно для сценариев с шумом: когда акустический канал проседает, визуальные признаки должны не просто добавляться к аудио, а помогать восстанавливать слабые места. Авторы показывают такой эффект на LRS3 и в опытах с babble-noise.

Метод. Основа похожа на современные AVSR-системы с большой языковой моделью: замороженный Whisper-medium для аудио, замороженный AV-HuBERT-large для видео и LLaMA-3.2-3B как декодер, загруженный в 4-битном виде. Новизна находится между модальностями. ReverseParallelHelix выполняет несколько раундов встречного обмена признаками с ограничениями на соответствие, QualitySensor оценивает деградацию аудиоканала и решает, когда включать усиление, а HelixReplication использует визуальные признаки как условие для восстановления аудиопредставления.

Результаты. На LRS3 с дополнительным VoxCeleb2 система дает WER 0.68%, тогда как LLaMA-AVSR получает 0.77%, а MMS-LLaMA 0.72% при сопоставимом каркасе. В шуме преимущество заметнее: при SNR -5 дБ DoubleHelix дает 11.6% WER против 17.0% у LLaMA-AVSR; при 0 дБ 3.8% против 4.4%; при 5 дБ 1.0% против 2.1%. Средняя ошибка по шумовым условиям снижается с 6.1% до 4.3%.

Ограничения. Шумовая проверка ограничена babble-noise, поэтому нельзя автоматически переносить вывод на реверберацию, клиппинг, уличный шум или закрытый рот. Данные LRS3 и VoxCeleb2 в основном англоязычные и видеоцентричные. Авторы дают вычислительную стоимость модулей, но не полноценную задержку потокового вывода. Кроме того, результат зависит от сильных предварительно обученных Whisper, AV-HuBERT и LLaMA, а не только от новой схемы слияния.

Фишка из статьи. В абляции видно, что выигрыш появляется не от одного большого блока, а от конкретной асимметричной итерации между модальностями. При сильном шуме удаление ReverseParallelHelix почти возвращает систему к менее устойчивому режиму, а простое "всегда усиливать" хуже, чем управляемое включение через QualitySensor.

Вариант при SNR -5 дБWERЧто убрали или изменили
Полная DoubleHelix11.6%Все три компонента включены
Без ReverseParallelHelix14.2%Нет многошагового встречного уточнения
Один раунд взаимодействия12.8%Итеративность резко сокращена
Два раунда взаимодействия12.1%Ближе к полной версии, но хуже трех раундов
Всегда усиливать аудио12.5%QualitySensor не выбирает режим адаптивно
Никогда не усиливать аудио12.4%Визуальная поддержка не используется для восстановления аудио

Как это читать: главный вывод не в том, что "визуальный канал помогает", а в том, что помогает именно управляемое и повторяемое согласование. Стоимость новых модулей при этом оценивается в 37.25 млн параметров и 34.79 GFLOPs, то есть менее 4% от вычислений декодирования большой языковой модели в их оценке.

Оригинальная статья на arXiv