Пространственный звук Микрофонные решётки Акустика помещений
arXiv eess.AS

Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion

arXiv:2608.16240

Получить Ambisonics высокого порядка из пяти нерегулярно расположенных микрофонов математически недоопределённо: псевдообращение усиливает шум, а обычная нейросеть усредняет неоднозначные пространственные компоненты. DiffM2A сочетает физическую проекцию на сферические гармоники с условной диффузией и умеет работать с разными геометриями решётки. Это редкая работа, где пространственная акустика, фаза и обобщение на новое расположение датчиков проверяются совместно.

Метод. GASHP строит для координат каждого микрофона и выбранной граничной модели аналитические направляющие сферических гармоник, затем выполняет энергетически нормированную согласованную проекцию без псевдообратной матрицы. Она переводит любую пятимикрофонную геометрию в общий модальный тензор, но намеренно оставляет масштаб и межмодальные утечки. Двухветвевой EDM получает и сырые комплексные спектры, и GASHP-признаки, после чего итеративно оценивает коэффициенты Ambisonics первого или второго порядка. Потери по вектору интенсивности и вращательной эквивариантности SO(3) удерживают межканальную фазу и структуру гармоник.

Результаты. В моделируемой комнате с двумя источниками для второго порядка метод даёт 9,74 дБ SI-SDR и когерентность 0,405 против 7,46 дБ и 0,254 у базовой сети с механизмом внимания. На реальных LOCATA получены 5,62 дБ и 0,71 против 2,11 дБ и 0,48. Порог когерентности -3 дБ сдвигается до 3106 Гц, тогда как у лучшей из сравниваемых нейросетей он 1945 Гц, у параметрического метода 2133 Гц. На четырёх невиданных круговых и линейных решётках средний SI-SDR равен 9,78 дБ против 7,41 дБ у ближайшей базовой модели.

Ограничения. Число входов остаётся фиксированным - меняется расположение пяти микрофонов, а не их количество. LOCATA используется и для донастройки по общей схеме, поэтому это не полностью обучение только на моделировании. Рассмотрены лишь первый и второй порядки, а физические модели не включают голову и корпус. Диффузия занимает 2,66 с на 4 с звука на RTX 5090, то есть RTF около 0,67 на очень мощном ускорителе и заметно хуже 0,23 у базовой сети с механизмом внимания; для носимого устройства это пока слишком дорого.

Фишка из статьи. Разбор компонентов показывает, что физические потери и порождающая модель дают независимый вклад. Простая U-Net поверх той же GASHP почти не лучше варианта без GASHP, а полный эффект возникает только при совместной диффузионной оценке и двух пространственных ограничениях.

Вариант, два источника SOASI-SDRКогерентностьОшибка амплитудыОшибка ILD
Только EDM6,75 дБ0,22411,52 дБ6,08 дБ
EDM + интенсивность7,32 дБ0,28810,64 дБ5,62 дБ
EDM + вращение8,54 дБ0,33210,08 дБ5,38 дБ
Полная модель9,74 дБ0,4059,27 дБ5,02 дБ
Без GASHP7,16 дБ0,27210,92 дБ5,75 дБ
GASHP + U-Net7,21 дБ0,28210,97 дБ5,87 дБ

Как это читать: вращательная потеря сильнее одной только интенсивности, но лучшие числа даёт их сочетание. Разрыв 2,53 дБ между полной диффузией и GASHP + U-Net поддерживает тезис авторов об неоднозначности задачи, хотя за него приходится платить временем обратного процесса.

Оригинальная статья на arXiv