Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion
Получить Ambisonics высокого порядка из пяти нерегулярно расположенных микрофонов математически недоопределённо: псевдообращение усиливает шум, а обычная нейросеть усредняет неоднозначные пространственные компоненты. DiffM2A сочетает физическую проекцию на сферические гармоники с условной диффузией и умеет работать с разными геометриями решётки. Это редкая работа, где пространственная акустика, фаза и обобщение на новое расположение датчиков проверяются совместно.
Метод. GASHP строит для координат каждого микрофона и выбранной граничной модели аналитические направляющие сферических гармоник, затем выполняет энергетически нормированную согласованную проекцию без псевдообратной матрицы. Она переводит любую пятимикрофонную геометрию в общий модальный тензор, но намеренно оставляет масштаб и межмодальные утечки. Двухветвевой EDM получает и сырые комплексные спектры, и GASHP-признаки, после чего итеративно оценивает коэффициенты Ambisonics первого или второго порядка. Потери по вектору интенсивности и вращательной эквивариантности SO(3) удерживают межканальную фазу и структуру гармоник.
Результаты. В моделируемой комнате с двумя источниками для второго порядка метод даёт 9,74 дБ SI-SDR и когерентность 0,405 против 7,46 дБ и 0,254 у базовой сети с механизмом внимания. На реальных LOCATA получены 5,62 дБ и 0,71 против 2,11 дБ и 0,48. Порог когерентности -3 дБ сдвигается до 3106 Гц, тогда как у лучшей из сравниваемых нейросетей он 1945 Гц, у параметрического метода 2133 Гц. На четырёх невиданных круговых и линейных решётках средний SI-SDR равен 9,78 дБ против 7,41 дБ у ближайшей базовой модели.
Ограничения. Число входов остаётся фиксированным - меняется расположение пяти микрофонов, а не их количество. LOCATA используется и для донастройки по общей схеме, поэтому это не полностью обучение только на моделировании. Рассмотрены лишь первый и второй порядки, а физические модели не включают голову и корпус. Диффузия занимает 2,66 с на 4 с звука на RTX 5090, то есть RTF около 0,67 на очень мощном ускорителе и заметно хуже 0,23 у базовой сети с механизмом внимания; для носимого устройства это пока слишком дорого.
Фишка из статьи. Разбор компонентов показывает, что физические потери и порождающая модель дают независимый вклад. Простая U-Net поверх той же GASHP почти не лучше варианта без GASHP, а полный эффект возникает только при совместной диффузионной оценке и двух пространственных ограничениях.
| Вариант, два источника SOA | SI-SDR | Когерентность | Ошибка амплитуды | Ошибка ILD |
|---|---|---|---|---|
| Только EDM | 6,75 дБ | 0,224 | 11,52 дБ | 6,08 дБ |
| EDM + интенсивность | 7,32 дБ | 0,288 | 10,64 дБ | 5,62 дБ |
| EDM + вращение | 8,54 дБ | 0,332 | 10,08 дБ | 5,38 дБ |
| Полная модель | 9,74 дБ | 0,405 | 9,27 дБ | 5,02 дБ |
| Без GASHP | 7,16 дБ | 0,272 | 10,92 дБ | 5,75 дБ |
| GASHP + U-Net | 7,21 дБ | 0,282 | 10,97 дБ | 5,87 дБ |
Как это читать: вращательная потеря сильнее одной только интенсивности, но лучшие числа даёт их сочетание. Разрыв 2,53 дБ между полной диффузией и GASHP + U-Net поддерживает тезис авторов об неоднозначности задачи, хотя за него приходится платить временем обратного процесса.