пространственный звук вокодер работа в реальном времени
arXiv eess.AS

CSAVocoder: A Causal Spatial Audio Vocoder Towards Real-Time Spatial Audio Generation

arXiv:2608.25404

CSAVocoder решает инженерно неприятную часть пространственного синтеза: превращает многоканальные мел-спектрограммы в бинауральный звук или амбисонику первого порядка строго причинно и с постоянной памятью. Авторы не скрывают обмен качества на задержку и отдельно измеряют хвост распределения времени обработки, а не только средний RTF.

Метод. Причинный генеративно-состязательный вокодер хранит состояние между блоками, а пространственный адаптер объединяет многоканальные мел-признаки с относительным положением источника и слушателя. Мел-адаптер сохраняет межканальные различия, отдельный дискриминатор штрафует пространственную несогласованность, а повышающая дискретизацию часть построена на причинных свертках и перестановке каналов.

Результаты. В бинауральной задаче модель достигает сходства угла 62,11 и расстояния 77,05, PESQ 2,109 и RTF 0,1587. Vocos быстрее и дает PESQ 2,510, но заметно уступает по пространственным показателям: 40,04 и 70,23. В прослушивании CSAVocoder получает MOS пространственной точности 4,25±0,16 и качества 4,09±0,21. Удаление мел-адаптера обрушает пространственные сходства до 42,60 и 65,39; это сильнее, чем удаление позиционных признаков или пространственного дискриминатора.

Ограничения. Задержка измерена на RTX 4090 при пакете 1 и не включает извлечение признаков, ввод-вывод и буферизацию, поэтому это не сквозная задержка системы. Эксперименты ограничены конкретными наборами и форматами пространственного звука. Причинность также уступает не причинным решениям по части показателей обычного качества.

Фишка из статьи. Среднее время вычисления почти не зависит от размера блока и держится около 15 мс; меняются главным образом алгоритмическая буферизация и RTF. Поэтому увеличение блока со 40 до 100 мс улучшает запас производительности, но неизбежно добавляет ожидание еще до начала вычисления.

БлокСреднее время99-й процентильRTF
40 мс15,24 мс18,62 мс0,3811
60 мс15,15 мс19,34 мс0,2526
80 мс15,52 мс24,67 мс0,1941
100 мс15,86 мс24,81 мс0,1587

Как это читать: все варианты быстрее реального времени, но минимальный RTF у 100-мс блока не означает минимальную отзывчивость. Для интерактивного звука 40-мс режим дает меньшую буферизацию ценой более узкого вычислительного запаса.

Оригинальная статья на arXiv