GIVE-KWS: добавление визуальных признаков для устойчивого к шуму поиска ключевых слов
GIVE-KWS решает поиск произнесённого примера ключевого слова в сильном шуме, добавляя чтение по губам не как коэффициент маски, а как отдельное фонемное свидетельство. Работа хорошо разделяет два вопроса: содержит ли видеопредставление фонетическую информацию и умеет ли механизм слияния реально передать её аудиоветви.
Метод. Аудиокадры обращаются cross-attention к последовательности признаков губ, после чего обучаемый скалярный затвор смешивает визуальный контекст с аудио. Нулевая инициализация начинает обучение с аудиорешения. Фонемное выравнивание и контрастивная функция связывают аудио, видео и текст, но при выводе принудительное выравнивание не требуется.
Результаты. На невиданных ключевых словах при -10 дБ EER падает с 33,19% у XEQ-Matcher до 9,01% у GIVE-KWS с AV-HuBERT, относительное снижение 72,9%. Если оставить тот же AV-HuBERT и заменить маскирование на добавление признаков, EER снижается с 10,14% до 9,01%; эквивалентный выигрыш по SNR равен 4,0 дБ на blind и 9,3 дБ на seen. Для слабого CNN-видеокодера эффект почти исчезает.
Ограничения. Модель обучается один раз, поэтому доверительные интервалы отражают только выборку тестовых пар, а не разброс обучения. Нужны фронтальное видео губ и чистый пример ключевого слова; тест ограничен MISP-QEKS и заранее сформированными парами. Обучение занимает около 72 часов на RTX 4090.
Фишка из статьи. Хороший механизм слияния не спасает плохое зрительное представление. Линейный пробник восстанавливает фонему с точностью лишь 6,2% из CNN-признаков и 27,0% из AV-HuBERT, после чего разница в EER становится радикальной.
| Видео и слияние, blind -10 дБ | EER, % |
|---|---|
| Только текст и звук | 35,15 |
| CNN-ResNet, маскирование | 33,19 |
| CNN-ResNet, GIVE | 33,13 |
| AV-HuBERT, маскирование | 10,14 |
| AV-HuBERT, GIVE | 9,01 |
Как это читать: почти весь переход от 33% к 10% даёт фонемно содержательный видеокодер, а GIVE снимает следующий слой ошибки. Это полезное предостережение: модальное слияние следует оценивать только после проверки того, что дополнительный канал несёт нужную информацию.