пространственный звук бинауральный звук генерация аудио
arXiv cs.SD

PLACE: позиционная адаптация скрытого пространства для генерации бинаурального звука

arXiv:2610.00630

PLACE превращает обычную мультимодальную генерацию звука в бинауральную, добавляя явное управление межушными временными и уровенными различиями. Вместо полного переобучения AudioX используется компактное условное преобразование скрытого пространства, которое можно задавать текстом, видео или опорным звуком.

Метод. Perception Encoder извлекает пространственные признаки, условные эмбеддинги согласуют разные модальности, а низкоранговый адаптер преобразует скрытый звуковой код. Обучение идёт в два этапа и включает потери по ILD и ITD после декодирования, то есть оптимизирует именно физические признаки бинауральной сцены, а не только скрытое представление.

Результаты. На FAIR-Play PLACE улучшает ViSAGe почти по всем объективным метрикам: например, на первом разбиении FSAD снижается с 15,9016 до 15,2879, ITD — с 0,1136 до 0,1077 мс, ILD — с 2,1306 до 2,0495 дБ. В слушательском тесте на видео MRSAudio средний балл равен 65,3 против 44,9 у ViSAGe; на синтетических видео Gemini — 58,4 против 16,5.

Ограничения. Субъективная проверка очень мала: по 10–11 слушателей в группе и несколько клипов. На текстовой генерации внутри обучающего распределения PLACE уступает SpatialSonic по среднему баллу 40,5 против 44,4. Объективные ILD/ITD-распределения не гарантируют правильной локализации каждого отдельного события.

Фишка из статьи. Добавление отдельных ILD/ITD-потерь без скрытого адаптера не помогает и даже ухудшает все показатели. Выигрыш появляется только тогда, когда пространственная поправка проходит через обучаемое низкоранговое преобразование и поддерживается выпадением модальностей.

Вариант на MRSAudioFSAD ↓ITD ↓ILD ↓SpatialCLAP Δ ↓
Базовый AudioX44,670,223,000,29
LoRA + Perception Encoder6,300,112,170,18
LoRA + PE + ILD/ITD без адаптера8,960,132,580,23
Полный PLACE5,140,111,980,04

Как это читать: физические потери эффективны лишь при архитектуре, способной локально перестроить скрытую сцену. Это полезное предостережение для фазо- и пространственно-осведомлённого улучшения звука: добавить метрику в функцию потерь недостаточно.

Оригинальная статья на arXiv