RIR Room acoustics ISM
Акустика помещений

PathRIR: быстрые RIR с сохранением late tail

90.5% nodes

PathRIR относится к акустике помещений, но напрямую полезна для речевых задач: такие RIR нужны для обучения улучшения речи, дереверберации, локализации и пространственного звука. Авторы ускоряют image-source simulation не грубым уменьшением порядка отражений, а отбором важных акустических путей с компенсацией позднего хвоста. Главный ход - сохранить ранние отражения явно, агрессивно проредить дерево поздних путей и затем восстановить энергетическую огибающую хвоста небольшой нейросетью.

Метод. Вместо оценки отдельного отражения PathRIR оценивает важность целого поддерева image-source paths. В признаках есть порядок отражения, координаты image source, родительский узел, накопленное затухание, расстояние и задержка до микрофона, геометрия комнаты. Для поздней части применяется Compensation-MLP: она не восстанавливает точную волну каждого отброшенного пути, а добавляет недостающую энергию в 64 временных бинах после 40 мс.

Результаты. Эксперимент сделан на случайных неправильных 3D-комнатах, полученных из 2D-полигонов: 1000 комнат для обучения, 20 для теста, до порядка отражений 10, частота 8 кГц. При Omax=10 PathRIR удаляет 90.5% узлов дерева и дает ускорение 279.39x относительно Pyroom и 42 133.45x относительно полного ISM. По точности он, конечно, хуже полного симулятора, но резко лучше варианта без компенсации хвоста: EDC-Err падает с 18.60 до 4.69 дБ, RT60-Err - со 121.12 до 36.84 мс.

Ограничения. Это пока не универсальный симулятор RIR: данные синтетические, сравнения с измеренными импульсными характеристиками нет, частота дискретизации 8 кГц и хвост обрезается на 0.5 с. Compensation-MLP восстанавливает энергию, а не точную фазово-временную структуру поздних отражений, поэтому для тонкой перцептивной оценки или высокочастотной реверберации переносимость нужно проверять отдельно.

Фишка из статьи. Цепляет не само ускорение, а то, насколько много качества возвращает компенсация позднего хвоста при почти нулевой цене. Без нее модель бы выглядела как быстрый, но слишком сухой симулятор.

МетодEDC-ErrRT60-ErrDRR-ErrNMSE
PathRIR4.69 дБ36.84 мс0.54 дБ-5.69 дБ
PathRIR без Compensation-MLP18.60 дБ121.12 мс2.88 дБ-5.09 дБ
Full-ISM0.002 дБ0.05 мс0.003 дБ-60.64 дБ

Как это читать: PathRIR не пытается быть численно равным Full-ISM, но компенсация резко исправляет параметры реверберационного хвоста. Для генерации обучающих RIR это может быть удачным компромиссом между физикой и скоростью.

Оригинальная статья на arXiv