PLACE: позиционная адаптация скрытого пространства для генерации бинаурального звука
PLACE превращает обычную мультимодальную генерацию звука в бинауральную, добавляя явное управление межушными временными и уровенными различиями. Вместо полного переобучения AudioX используется компактное условное преобразование скрытого пространства, которое можно задавать текстом, видео или опорным звуком.
Метод. Perception Encoder извлекает пространственные признаки, условные эмбеддинги согласуют разные модальности, а низкоранговый адаптер преобразует скрытый звуковой код. Обучение идёт в два этапа и включает потери по ILD и ITD после декодирования, то есть оптимизирует именно физические признаки бинауральной сцены, а не только скрытое представление.
Результаты. На FAIR-Play PLACE улучшает ViSAGe почти по всем объективным метрикам: например, на первом разбиении FSAD снижается с 15,9016 до 15,2879, ITD — с 0,1136 до 0,1077 мс, ILD — с 2,1306 до 2,0495 дБ. В слушательском тесте на видео MRSAudio средний балл равен 65,3 против 44,9 у ViSAGe; на синтетических видео Gemini — 58,4 против 16,5.
Ограничения. Субъективная проверка очень мала: по 10–11 слушателей в группе и несколько клипов. На текстовой генерации внутри обучающего распределения PLACE уступает SpatialSonic по среднему баллу 40,5 против 44,4. Объективные ILD/ITD-распределения не гарантируют правильной локализации каждого отдельного события.
Фишка из статьи. Добавление отдельных ILD/ITD-потерь без скрытого адаптера не помогает и даже ухудшает все показатели. Выигрыш появляется только тогда, когда пространственная поправка проходит через обучаемое низкоранговое преобразование и поддерживается выпадением модальностей.
| Вариант на MRSAudio | FSAD ↓ | ITD ↓ | ILD ↓ | SpatialCLAP Δ ↓ |
|---|---|---|---|---|
| Базовый AudioX | 44,67 | 0,22 | 3,00 | 0,29 |
| LoRA + Perception Encoder | 6,30 | 0,11 | 2,17 | 0,18 |
| LoRA + PE + ILD/ITD без адаптера | 8,96 | 0,13 | 2,58 | 0,23 |
| Полный PLACE | 5,14 | 0,11 | 1,98 | 0,04 |
Как это читать: физические потери эффективны лишь при архитектуре, способной локально перестроить скрытую сцену. Это полезное предостережение для фазо- и пространственно-осведомлённого улучшения звука: добавить метрику в функцию потерь недостаточно.