ключевые слова аудиовизуальная речь шумоустойчивость
arXiv eess.AS

GIVE-KWS: добавление визуальных признаков для устойчивого к шуму поиска ключевых слов

arXiv:2610.07046

GIVE-KWS решает поиск произнесённого примера ключевого слова в сильном шуме, добавляя чтение по губам не как коэффициент маски, а как отдельное фонемное свидетельство. Работа хорошо разделяет два вопроса: содержит ли видеопредставление фонетическую информацию и умеет ли механизм слияния реально передать её аудиоветви.

Метод. Аудиокадры обращаются cross-attention к последовательности признаков губ, после чего обучаемый скалярный затвор смешивает визуальный контекст с аудио. Нулевая инициализация начинает обучение с аудиорешения. Фонемное выравнивание и контрастивная функция связывают аудио, видео и текст, но при выводе принудительное выравнивание не требуется.

Результаты. На невиданных ключевых словах при -10 дБ EER падает с 33,19% у XEQ-Matcher до 9,01% у GIVE-KWS с AV-HuBERT, относительное снижение 72,9%. Если оставить тот же AV-HuBERT и заменить маскирование на добавление признаков, EER снижается с 10,14% до 9,01%; эквивалентный выигрыш по SNR равен 4,0 дБ на blind и 9,3 дБ на seen. Для слабого CNN-видеокодера эффект почти исчезает.

Ограничения. Модель обучается один раз, поэтому доверительные интервалы отражают только выборку тестовых пар, а не разброс обучения. Нужны фронтальное видео губ и чистый пример ключевого слова; тест ограничен MISP-QEKS и заранее сформированными парами. Обучение занимает около 72 часов на RTX 4090.

Фишка из статьи. Хороший механизм слияния не спасает плохое зрительное представление. Линейный пробник восстанавливает фонему с точностью лишь 6,2% из CNN-признаков и 27,0% из AV-HuBERT, после чего разница в EER становится радикальной.

Видео и слияние, blind -10 дБEER, %
Только текст и звук35,15
CNN-ResNet, маскирование33,19
CNN-ResNet, GIVE33,13
AV-HuBERT, маскирование10,14
AV-HuBERT, GIVE9,01

Как это читать: почти весь переход от 33% к 10% даёт фонемно содержательный видеокодер, а GIVE снимает следующий слой ошибки. Это полезное предостережение: модальное слияние следует оценивать только после проверки того, что дополнительный канал несёт нужную информацию.

Оригинальная статья на arXiv