Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Model
Авторы восстанавливают высокопорядковый амбисонический импульсный отклик помещения по сигналам редкой или нерегулярной микрофонной решётки. Задача принципиально недоопределена: семь микрофонов не измеряют все 169 коэффициентов 12-го порядка, поэтому метод сочетает физическую согласованность с измерениями и обученное распределение правдоподобной акустики помещений.
Метод. Диффузионный априорный закон обучается только на импульсных откликах в сферических гармониках и не привязан к устройству. Его первая ступень обрабатывает STFT с помощью NCSN++, моделируя частотно-зависимый хвост реверберации; временная U-Net отдельно уточняет первые 70 мс с прямым звуком и ранними отражениями. Случайные матрицы вращения Вигнера обеспечивают согласованность при повороте поля. При выводе известная передаточная функция решётки входит в диффузионную выборку через сжатое спектральное расстояние после проекции в измеримое подпространство.
Результаты. Для семимикрофонных Aria Glasses на внутреннем FDTD-наборе ошибка энергетического спада EDC равна 0,018 против 0,049 у линейного кодировщика, 0,043 у нейросетевого и 0,026 у привязанной к устройству условной диффузии. Ошибка ранних отражений NPM составляет 0,874 против 0,999, 1,080 и 0,938. На Treble-10 получены EDC 0,019 и NPM 0,803; у условной диффузии 0,022 и 0,912. В прослушивании с 13 участниками метод лучше остальных на моделированных комнатах и сохраняет высокие оценки после поворота поля; на трёх измеренных откликах преимущество над условной диффузией исчезает из-за сдвига распределения.
Ограничения. Парные численные тесты полностью моделированные и используют одну семимикрофонную конструкцию, несмотря на заявленную независимость от устройства. Реальная проверка содержит лишь три отклика Eigenmike, один барабанный фрагмент, обобщённую HRTF и 13 слушателей. Не приводятся время выборки и вычислительная стоимость. Поскольку недостающая пространственная информация генерируется априорной моделью, результат физически согласован с микрофонами, но не обязан совпадать с единственным истинным полем.
Фишка из статьи. Разбор показывает, что одной спектрограммы или одной временной волны недостаточно. Лучшая точность получается только при совместном моделировании поздней реверберации, ранних отражений и проекции ограничения в амбисоническое подпространство.
| Вариант на FDTD | EDC, меньше лучше | NPM, меньше лучше |
|---|---|---|
| Полный метод | 0,018 | 0,874 |
| Ограничение в пространстве микрофонов | 0,025 | 0,967 |
| Только STFT-сеть | 0,021 | 1,065 |
| Только временная сеть | 0,022 | 1,012 |
Как это читать: EDC оценивает поздний спад энергии, NPM - первые 100 мс. Частотно-временная сеть ещё неплохо описывает хвост, но теряет раннюю геометрию; временная сеть ведёт себя наоборот. Проекция особенно важна для слабых гармоник высокого порядка, которые почти не наблюдаются семью микрофонами.