Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes
Работа восстанавливает пространственный звук первого порядка для панорамного видео, когда из четырёх каналов Ambisonics записан только всенаправленный W. Это сложнее обычного «разместить голос по направлению»: нужно синтезировать три комплексных канала так, чтобы сохранить фазовые связи и воспринимаемое положение источника в реальных сценах. Авторы добавляют 8,9-часовой набор YT-SPEECH и разделяют задачу на зрительную локализацию и акустическую отрисовку.
Метод. Предобученная аудиовизуальная сеть строит для каждого кадра распределение по сетке 7 на 14 на всей сфере; круговое дополнение учитывает шов панорамной развёртки. Пиковая концентрация и энтропия карты дают коэффициент уверенности. Комплексный U-Net получает STFT канала W и через управляемую FiLM-модуляцию предсказывает комплексные маски для Y, Z и X. При неуверенной карте зрительное условие ослабляется, чтобы сеть могла опереться на звук. Потери объединяют многомасштабную STFT, амплитуду и волну; при обучении согласованно вращаются и панорама, и FOA-каналы. Записи длительностью по 5 с взяты из 197 исходных видео, а разбиение сделано по видео, чтобы одинаковые сцены не попали в разные части.
Результаты. Полная модель получает ошибку волны 1,15 на 10-3, фазовую ошибку 1,59, угловую ошибку 0,64, PESQ 3,42, MOS качества 3,63 и MOS пространственного положения 3,16. Без видео соответствующие значения равны 1,59, 1,96, 0,73, 2,50, 3,24 и 2,28. Аналитический Ambisonics-кодировщик по оценённому направлению чуть лучше по MOS качества, 3,68 против 3,63, но хуже по угловой ошибке и MOS положения. На YT-SPEECH комплексное расстояние STFT снижается с 1,14 у SAG до 0,85.
Ограничения. YT-SPEECH содержит лишь 8,9 часа тщательно отобранных роликов, поэтому не отражает всю неоднородность пользовательского видео. Перекрывающиеся источники, шум и диффузное поле остаются основными отказами. Прослушивание мало: девять участников оценили по пять фрагментов на метод. Для PESQ авторы зануляют правильный W-канал, чтобы он не доминировал, что полезно для сравнения восстановленных компонентов, но не равно качеству полного воспроизведения. Работа не сообщает задержку и не демонстрирует потоковый режим.
Фишка из статьи. Простого предобученного зрительного признака недостаточно: локализатор нужно адаптировать совместно с отрисовщиком, иначе видео способно навредить сильнее, чем его отсутствие.
| Вариант | Фазовая ошибка | Угловая ошибка | PESQ | MOS положения |
|---|---|---|---|---|
| Без видео | 1,96 | 0,73 | 2,50 | 2,28 |
| Прямой зрительный признак | 1,66 | 0,66 | 1,78 | 3,02 |
| Замороженный локализатор | 1,90 | 1,04 | 1,41 | 2,34 |
| Полная модель | 1,59 | 0,64 | 3,42 | 3,16 |
Как это читать: замороженная карта действительно содержит направление, но её ошибки не согласованы с задачей восстановления FOA и приводят к худшей угловой точности. Совместная адаптация и затвор уверенности превращают зрительный сигнал из жёсткой команды в проверяемую подсказку.