Mapping Written Words to Spoken Words in a Different Language Using Only Visual Grounding
Работа учит находить в хинди произнесённый эквивалент английского письменного слова без параллельного текста и двуязычной речевой разметки. Связующим звеном служат изображения: английское слово и фрагмент хинди считаются близкими, если регулярно относятся к одному визуальному объекту.
Метод. Используется Hindi Places: 100 тысяч изображений со звуковыми описаниями на хинди. Английские подписи создают Tag2Text, BLIP2 и GIT, после пересечения и ручной очистки остаётся словарь из 100 визуально наблюдаемых понятий. Звуковые признаки берутся из седьмого слоя HuBERT Base. Авторы сравнивают выравнивание непрерывных признаков CFA и дискретных единиц DFA, а также обучение только на положительных парах, с обычными отрицательными и с семантически близкими отрицательными примерами.
Результаты. Лучший CFA с положительными и отрицательными парами получает P@10 63,0% для поиска слова и 49,9% для его локализации при IoU ≥ 0,5. Только положительные пары дают 47,7% и 23,6%; отрицательные примеры тем самым более чем удваивают локализацию. Текстовый верхний предел достигает 100% и 89,8%. На одном языке локализация равна 75,4%, тогда как в направлении английский–хинди — 49,9%, что указывает на потери визуального и культурного соответствия, а не только на различие языков.
Ограничения. Словарь мал и состоит преимущественно из предметных существительных; часть понятий исключена вручную. Автоматические английские подписи отражают смещения западных моделей изображений. Транскрипции и выравниватель всё же нужны для оценки, а непрерывное сопоставление 250 фрагментов занимает 2 мин 15 с против 24 с у дискретного варианта.
Фишка из статьи. Отрицательные пары нужны не столько для грубого обнаружения, сколько для временной локализации: без них модель легко связывает слово со всей сценой или сопутствующим объектом. Выигрыш CFA сопровождается почти шестикратной ценой сопоставления.
| Представление и пары | P@10, поиск | P@10, локализация | Время для 250 фрагментов |
|---|---|---|---|
| DFA, только положительные | 49,7% | 16,8% | 24 с |
| DFA, положительные и отрицательные | 56,8% | 34,2% | 24 с |
| CFA, только положительные | 47,7% | 23,6% | 2 мин 15 с |
| CFA, положительные и отрицательные | 63,0% | 49,9% | 2 мин 15 с |
Как это читать: дискретизация сильно ускоряет поиск, но непрерывные признаки лучше сохраняют границы слова. Самая крупная прибавка возникает от обучения на контрастных сценах, которые заставляют модель отличать точный фрагмент речи от общего контекста изображения.