малоресурсная речь поиск ключевых слов визуальное заземление
arXiv cs.CL

Mapping Written Words to Spoken Words in a Different Language Using Only Visual Grounding

arXiv:2608.26925

Работа учит находить в хинди произнесённый эквивалент английского письменного слова без параллельного текста и двуязычной речевой разметки. Связующим звеном служат изображения: английское слово и фрагмент хинди считаются близкими, если регулярно относятся к одному визуальному объекту.

Метод. Используется Hindi Places: 100 тысяч изображений со звуковыми описаниями на хинди. Английские подписи создают Tag2Text, BLIP2 и GIT, после пересечения и ручной очистки остаётся словарь из 100 визуально наблюдаемых понятий. Звуковые признаки берутся из седьмого слоя HuBERT Base. Авторы сравнивают выравнивание непрерывных признаков CFA и дискретных единиц DFA, а также обучение только на положительных парах, с обычными отрицательными и с семантически близкими отрицательными примерами.

Результаты. Лучший CFA с положительными и отрицательными парами получает P@10 63,0% для поиска слова и 49,9% для его локализации при IoU ≥ 0,5. Только положительные пары дают 47,7% и 23,6%; отрицательные примеры тем самым более чем удваивают локализацию. Текстовый верхний предел достигает 100% и 89,8%. На одном языке локализация равна 75,4%, тогда как в направлении английский–хинди — 49,9%, что указывает на потери визуального и культурного соответствия, а не только на различие языков.

Ограничения. Словарь мал и состоит преимущественно из предметных существительных; часть понятий исключена вручную. Автоматические английские подписи отражают смещения западных моделей изображений. Транскрипции и выравниватель всё же нужны для оценки, а непрерывное сопоставление 250 фрагментов занимает 2 мин 15 с против 24 с у дискретного варианта.

Фишка из статьи. Отрицательные пары нужны не столько для грубого обнаружения, сколько для временной локализации: без них модель легко связывает слово со всей сценой или сопутствующим объектом. Выигрыш CFA сопровождается почти шестикратной ценой сопоставления.

Представление и парыP@10, поискP@10, локализацияВремя для 250 фрагментов
DFA, только положительные49,7%16,8%24 с
DFA, положительные и отрицательные56,8%34,2%24 с
CFA, только положительные47,7%23,6%2 мин 15 с
CFA, положительные и отрицательные63,0%49,9%2 мин 15 с

Как это читать: дискретизация сильно ускоряет поиск, но непрерывные признаки лучше сохраняют границы слова. Самая крупная прибавка возникает от обучения на контрастных сценах, которые заставляют модель отличать точный фрагмент речи от общего контекста изображения.

Оригинальная статья на arXiv