DoubleHelix: итеративное слияние аудио и артикуляции для AVSR
DoubleHelix рассматривает аудиовизуальное распознавание речи как задачу не разового объединения признаков, а последовательного уточнения между звуком и изображением губ. Это важно для сценариев с шумом: когда акустический канал проседает, визуальные признаки должны не просто добавляться к аудио, а помогать восстанавливать слабые места. Авторы показывают такой эффект на LRS3 и в опытах с babble-noise.
Метод. Основа похожа на современные AVSR-системы с большой языковой моделью: замороженный Whisper-medium для аудио, замороженный AV-HuBERT-large для видео и LLaMA-3.2-3B как декодер, загруженный в 4-битном виде. Новизна находится между модальностями. ReverseParallelHelix выполняет несколько раундов встречного обмена признаками с ограничениями на соответствие, QualitySensor оценивает деградацию аудиоканала и решает, когда включать усиление, а HelixReplication использует визуальные признаки как условие для восстановления аудиопредставления.
Результаты. На LRS3 с дополнительным VoxCeleb2 система дает WER 0.68%, тогда как LLaMA-AVSR получает 0.77%, а MMS-LLaMA 0.72% при сопоставимом каркасе. В шуме преимущество заметнее: при SNR -5 дБ DoubleHelix дает 11.6% WER против 17.0% у LLaMA-AVSR; при 0 дБ 3.8% против 4.4%; при 5 дБ 1.0% против 2.1%. Средняя ошибка по шумовым условиям снижается с 6.1% до 4.3%.
Ограничения. Шумовая проверка ограничена babble-noise, поэтому нельзя автоматически переносить вывод на реверберацию, клиппинг, уличный шум или закрытый рот. Данные LRS3 и VoxCeleb2 в основном англоязычные и видеоцентричные. Авторы дают вычислительную стоимость модулей, но не полноценную задержку потокового вывода. Кроме того, результат зависит от сильных предварительно обученных Whisper, AV-HuBERT и LLaMA, а не только от новой схемы слияния.
Фишка из статьи. В абляции видно, что выигрыш появляется не от одного большого блока, а от конкретной асимметричной итерации между модальностями. При сильном шуме удаление ReverseParallelHelix почти возвращает систему к менее устойчивому режиму, а простое "всегда усиливать" хуже, чем управляемое включение через QualitySensor.
| Вариант при SNR -5 дБ | WER | Что убрали или изменили |
|---|---|---|
| Полная DoubleHelix | 11.6% | Все три компонента включены |
| Без ReverseParallelHelix | 14.2% | Нет многошагового встречного уточнения |
| Один раунд взаимодействия | 12.8% | Итеративность резко сокращена |
| Два раунда взаимодействия | 12.1% | Ближе к полной версии, но хуже трех раундов |
| Всегда усиливать аудио | 12.5% | QualitySensor не выбирает режим адаптивно |
| Никогда не усиливать аудио | 12.4% | Визуальная поддержка не используется для восстановления аудио |
Как это читать: главный вывод не в том, что "визуальный канал помогает", а в том, что помогает именно управляемое и повторяемое согласование. Стоимость новых модулей при этом оценивается в 37.25 млн параметров и 34.79 GFLOPs, то есть менее 4% от вычислений декодирования большой языковой модели в их оценке.