Распознавание речи Видео Optimal transport
Аудиовизуальное распознавание

Оптимальный транспорт для аудиовизуального распознавания речи

WER 7.16%

Статья про аудиовизуальное распознавание речи с языковой моделью: авторы пытаются исправить не сам декодер, а место, где акустические и визуальные признаки превращаются в подсказки для LLaMA. Обычная схема просто объединяет выходы Whisper и AV-HuBERT, а здесь перед объединением признаки выравниваются с пространством текстовых токенов через оптимальный транспорт. Это интересный ход для шумных условий: модель не только видит губы и слышит сигнал, но и учится, какие куски аудио и видео действительно соответствуют языковым единицам.

Метод. Система использует Whisper как акустический кодировщик, AV-HuBERT как визуальный кодировщик и LLaMA3.2-3B как декодер. Акустические, визуальные и текстовые представления рассматриваются как эмпирические распределения; между аудио-текстом и видео-текстом решается энтропийно регуляризованная задача оптимального транспорта с приближением Sinkhorn. Полученные матрицы соответствий используются как мягкая разметка для контрастивного выравнивания. Дополнительно введены виртуальные buckets: они поглощают шум, паузы и нерелевантные кадры, которые не стоит насильно сопоставлять с текстом.

Результаты. Оценка проведена на LRS3-TED: 433 часа для обучения, около 1 часа для проверки и 1 часа для теста. В шумном обучении базовая схема без выравнивания дает WER 8.34% при SNR -5 dB, 2.82% при 0 dB, 1.29% при 5 dB и 0.89% на чистом сигнале. Лучший вариант с выравниванием снижает эти значения до 7.16%, 2.34%, 1.11% и 0.73%. На тех же условиях MMS-LLaMA имеет 7.44%, 2.66%, 1.30% и 0.95%, то есть выигрыш особенно заметен на сильном шуме и на чистом тесте.

Ограничения. Работа проверена на одном основном наборе LRS3-TED и одном типе добавочного шума, поэтому перенос на реальные многомикрофонные или телефонные записи не доказан. В методе есть несколько чувствительных гиперпараметров оптимального транспорта: вес alignment loss, энтропийная регуляризация, margin виртуального bucket. Авторы подбирают их эмпирически и сами отмечают, что совместная оптимизация остается открытой задачей. Кроме того, улучшения в абсолютных процентах WER умеренные, а вычислительная цена OT-модуля отдельно не разобрана.

Фишка из статьи. Виртуальный bucket - небольшая, но полезная инженерная деталь. Он разрешает части аудио или видео не иметь текстового соответствия, что важно для пауз, фонового шума и кадров без информативной артикуляции.

МетодWER -5 dBWER 0 dBWER 5 dBWER clean
Без выравнивания8.342.821.290.89
OT без bucket8.062.611.230.76
OT с bucket7.982.461.150.80
Лучший OT-вариант7.162.341.110.73

Как это читать: bucket сам по себе не делает весь выигрыш, но стабильно помогает на шумных режимах. Главный эффект возникает от явного языкового якоря для аудио- и видеопризнаков: модель меньше полагается на простое склеивание модальностей и лучше выдерживает сильный шум.

Оригинальная статья на arXiv