CSAVocoder: A Causal Spatial Audio Vocoder Towards Real-Time Spatial Audio Generation
CSAVocoder решает инженерно неприятную часть пространственного синтеза: превращает многоканальные мел-спектрограммы в бинауральный звук или амбисонику первого порядка строго причинно и с постоянной памятью. Авторы не скрывают обмен качества на задержку и отдельно измеряют хвост распределения времени обработки, а не только средний RTF.
Метод. Причинный генеративно-состязательный вокодер хранит состояние между блоками, а пространственный адаптер объединяет многоканальные мел-признаки с относительным положением источника и слушателя. Мел-адаптер сохраняет межканальные различия, отдельный дискриминатор штрафует пространственную несогласованность, а повышающая дискретизацию часть построена на причинных свертках и перестановке каналов.
Результаты. В бинауральной задаче модель достигает сходства угла 62,11 и расстояния 77,05, PESQ 2,109 и RTF 0,1587. Vocos быстрее и дает PESQ 2,510, но заметно уступает по пространственным показателям: 40,04 и 70,23. В прослушивании CSAVocoder получает MOS пространственной точности 4,25±0,16 и качества 4,09±0,21. Удаление мел-адаптера обрушает пространственные сходства до 42,60 и 65,39; это сильнее, чем удаление позиционных признаков или пространственного дискриминатора.
Ограничения. Задержка измерена на RTX 4090 при пакете 1 и не включает извлечение признаков, ввод-вывод и буферизацию, поэтому это не сквозная задержка системы. Эксперименты ограничены конкретными наборами и форматами пространственного звука. Причинность также уступает не причинным решениям по части показателей обычного качества.
Фишка из статьи. Среднее время вычисления почти не зависит от размера блока и держится около 15 мс; меняются главным образом алгоритмическая буферизация и RTF. Поэтому увеличение блока со 40 до 100 мс улучшает запас производительности, но неизбежно добавляет ожидание еще до начала вычисления.
| Блок | Среднее время | 99-й процентиль | RTF |
|---|---|---|---|
| 40 мс | 15,24 мс | 18,62 мс | 0,3811 |
| 60 мс | 15,15 мс | 19,34 мс | 0,2526 |
| 80 мс | 15,52 мс | 24,67 мс | 0,1941 |
| 100 мс | 15,86 мс | 24,81 мс | 0,1587 |
Как это читать: все варианты быстрее реального времени, но минимальный RTF у 100-мс блока не означает минимальную отзывчивость. Для интерактивного звука 40-мс режим дает меньшую буферизацию ценой более узкого вычислительного запаса.