Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling
ADEPS решает классическую обратную задачу пространственного звука: по сигналам произвольной микрофонной решётки нужно восстановить коэффициенты Ambisonics, не обучая сеть заново для каждого числа и расположения микрофонов. Вместо прямого отображения авторы учат диффузионный априорный закон только на идеальных коэффициентах, а геометрию конкретной решётки вводят уже при восстановлении через физическую модель измерения. Это удачное соединение акустики помещений, сферических гармоник и порождающего восстановления.
Метод. Линейный кодировщик сначала строит зашумлённое приближение коэффициентов пятого порядка. В сжатой комплексной STFT амплитуда преобразуется степенной функцией, а фаза сохраняется. NCSN++ на 30,8 млн параметров задаёт априорное распределение идеального пространственного поля; во время 150 обратных шагов Diffusion Posterior Sampling добавляет градиент согласованности с измеренными каналами. Прямой оператор явно включает декомпрессию, пространственное сэмплирование известной матрицей микрофонов и повторное линейное кодирование. Обучение использует 20 тыс. сцен VCTK, проверка - 1 тыс. сцен WSJ0 в помещениях 6-10 на 6-10 на 2-3 м с T60 от 0,1 до 0,4 с. Проверены 13 незнакомых решёток: по четыре случайные конфигурации из 4, 5 и 6 микрофонов и Project Aria.
Результаты. При совпадении порядка физической модели и априорного закона ADEPS повышает SI-SDR линейного кодирования с 6,80 до 11,66 дБ для 4 микрофонов, с 7,95 до 14,18 для 5, с 9,26 до 16,20 для 6 и с 3,63 до 10,00 для Aria. При намеренном несовпадении порядков преимущество сохраняется: 9,85/10,57/12,67/4,94 дБ против 6,71/7,82/9,09/3,31. На отдельной 4-микрофонной решётке ADEPS даёт 11,67 дБ против 8,03 у U-Net, хотя U-Net обучался именно на этой геометрии. Одновременно ADEPS лучше по спектральной ошибке и межушным уровням, но уступает U-Net по когерентности.
Ограничения. Все помещения и импульсные характеристики синтетические; в проверке нет измеренных комнат и субъективного прослушивания. Алгоритму нужны точные координаты и передаточные функции микрофонов, а 150 диффузионных шагов почти наверняка исключают потоковую работу, но время вывода не сообщается. Априорный закон обучен для конечного порядка, а оценка проводится лишь для коэффициентов первого порядка. При несовпадении порядка высокочастотное пространственное наложение заметно ухудшает когерентность; авторы прямо ограничивают метод пространственно разрешимыми порядками.
Фишка из статьи. Сравнение с сетью, специально обученной на одной решётке, показывает полезный, но не односторонний обмен между точностью волны и пространственной когерентностью.
| Метод, 4 микрофона | SI-SDR | Спектральная ошибка | Когерентность | Ошибка ILD | Ошибка IC |
|---|---|---|---|---|---|
| Линейный | 7,03 дБ | 9,74 дБ | 0,81 | 3,21 дБ | 0,13 |
| U-Net для этой решётки | 8,03 дБ | 5,79 дБ | 0,85 | 2,10 дБ | 0,11 |
| ADEPS без знакомства с решёткой | 11,67 дБ | 5,31 дБ | 0,78 | 0,92 дБ | 0,06 |
Как это читать: ADEPS заметно выигрывает по общей реконструкции и межушным признакам, но лучшая когерентность остаётся у специализированного U-Net. Физически обусловленное диффузионное восстановление не устраняет все виды пространственной ошибки одинаково.