Амбисоника Акустика помещений Диффузионное восстановление
arXiv eess.AS

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

arXiv:2608.24558

ADEPS решает классическую обратную задачу пространственного звука: по сигналам произвольной микрофонной решётки нужно восстановить коэффициенты Ambisonics, не обучая сеть заново для каждого числа и расположения микрофонов. Вместо прямого отображения авторы учат диффузионный априорный закон только на идеальных коэффициентах, а геометрию конкретной решётки вводят уже при восстановлении через физическую модель измерения. Это удачное соединение акустики помещений, сферических гармоник и порождающего восстановления.

Метод. Линейный кодировщик сначала строит зашумлённое приближение коэффициентов пятого порядка. В сжатой комплексной STFT амплитуда преобразуется степенной функцией, а фаза сохраняется. NCSN++ на 30,8 млн параметров задаёт априорное распределение идеального пространственного поля; во время 150 обратных шагов Diffusion Posterior Sampling добавляет градиент согласованности с измеренными каналами. Прямой оператор явно включает декомпрессию, пространственное сэмплирование известной матрицей микрофонов и повторное линейное кодирование. Обучение использует 20 тыс. сцен VCTK, проверка - 1 тыс. сцен WSJ0 в помещениях 6-10 на 6-10 на 2-3 м с T60 от 0,1 до 0,4 с. Проверены 13 незнакомых решёток: по четыре случайные конфигурации из 4, 5 и 6 микрофонов и Project Aria.

Результаты. При совпадении порядка физической модели и априорного закона ADEPS повышает SI-SDR линейного кодирования с 6,80 до 11,66 дБ для 4 микрофонов, с 7,95 до 14,18 для 5, с 9,26 до 16,20 для 6 и с 3,63 до 10,00 для Aria. При намеренном несовпадении порядков преимущество сохраняется: 9,85/10,57/12,67/4,94 дБ против 6,71/7,82/9,09/3,31. На отдельной 4-микрофонной решётке ADEPS даёт 11,67 дБ против 8,03 у U-Net, хотя U-Net обучался именно на этой геометрии. Одновременно ADEPS лучше по спектральной ошибке и межушным уровням, но уступает U-Net по когерентности.

Ограничения. Все помещения и импульсные характеристики синтетические; в проверке нет измеренных комнат и субъективного прослушивания. Алгоритму нужны точные координаты и передаточные функции микрофонов, а 150 диффузионных шагов почти наверняка исключают потоковую работу, но время вывода не сообщается. Априорный закон обучен для конечного порядка, а оценка проводится лишь для коэффициентов первого порядка. При несовпадении порядка высокочастотное пространственное наложение заметно ухудшает когерентность; авторы прямо ограничивают метод пространственно разрешимыми порядками.

Фишка из статьи. Сравнение с сетью, специально обученной на одной решётке, показывает полезный, но не односторонний обмен между точностью волны и пространственной когерентностью.

Метод, 4 микрофонаSI-SDRСпектральная ошибкаКогерентностьОшибка ILDОшибка IC
Линейный7,03 дБ9,74 дБ0,813,21 дБ0,13
U-Net для этой решётки8,03 дБ5,79 дБ0,852,10 дБ0,11
ADEPS без знакомства с решёткой11,67 дБ5,31 дБ0,780,92 дБ0,06

Как это читать: ADEPS заметно выигрывает по общей реконструкции и межушным признакам, но лучшая когерентность остаётся у специализированного U-Net. Физически обусловленное диффузионное восстановление не устраняет все виды пространственной ошибки одинаково.

Оригинальная статья на arXiv