Пространственный звук Фазовая обработка 360°-видео
arXiv eess.AS

Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes

arXiv:2608.24579

Работа восстанавливает пространственный звук первого порядка для панорамного видео, когда из четырёх каналов Ambisonics записан только всенаправленный W. Это сложнее обычного «разместить голос по направлению»: нужно синтезировать три комплексных канала так, чтобы сохранить фазовые связи и воспринимаемое положение источника в реальных сценах. Авторы добавляют 8,9-часовой набор YT-SPEECH и разделяют задачу на зрительную локализацию и акустическую отрисовку.

Метод. Предобученная аудиовизуальная сеть строит для каждого кадра распределение по сетке 7 на 14 на всей сфере; круговое дополнение учитывает шов панорамной развёртки. Пиковая концентрация и энтропия карты дают коэффициент уверенности. Комплексный U-Net получает STFT канала W и через управляемую FiLM-модуляцию предсказывает комплексные маски для Y, Z и X. При неуверенной карте зрительное условие ослабляется, чтобы сеть могла опереться на звук. Потери объединяют многомасштабную STFT, амплитуду и волну; при обучении согласованно вращаются и панорама, и FOA-каналы. Записи длительностью по 5 с взяты из 197 исходных видео, а разбиение сделано по видео, чтобы одинаковые сцены не попали в разные части.

Результаты. Полная модель получает ошибку волны 1,15 на 10-3, фазовую ошибку 1,59, угловую ошибку 0,64, PESQ 3,42, MOS качества 3,63 и MOS пространственного положения 3,16. Без видео соответствующие значения равны 1,59, 1,96, 0,73, 2,50, 3,24 и 2,28. Аналитический Ambisonics-кодировщик по оценённому направлению чуть лучше по MOS качества, 3,68 против 3,63, но хуже по угловой ошибке и MOS положения. На YT-SPEECH комплексное расстояние STFT снижается с 1,14 у SAG до 0,85.

Ограничения. YT-SPEECH содержит лишь 8,9 часа тщательно отобранных роликов, поэтому не отражает всю неоднородность пользовательского видео. Перекрывающиеся источники, шум и диффузное поле остаются основными отказами. Прослушивание мало: девять участников оценили по пять фрагментов на метод. Для PESQ авторы зануляют правильный W-канал, чтобы он не доминировал, что полезно для сравнения восстановленных компонентов, но не равно качеству полного воспроизведения. Работа не сообщает задержку и не демонстрирует потоковый режим.

Фишка из статьи. Простого предобученного зрительного признака недостаточно: локализатор нужно адаптировать совместно с отрисовщиком, иначе видео способно навредить сильнее, чем его отсутствие.

ВариантФазовая ошибкаУгловая ошибкаPESQMOS положения
Без видео1,960,732,502,28
Прямой зрительный признак1,660,661,783,02
Замороженный локализатор1,901,041,412,34
Полная модель1,590,643,423,16

Как это читать: замороженная карта действительно содержит направление, но её ошибки не согласованы с задачей восстановления FOA и приводят к худшей угловой точности. Совместная адаптация и затвор уверенности превращают зрительный сигнал из жёсткой команды в проверяемую подсказку.

Оригинальная статья на arXiv