Улучшение аудио Психоакустика Mamba
Улучшение аудио

AEROMamba: улучшение аудио через дифференцируемую психоакустическую loss

14x faster

Работа не ограничивается речью, но полезна для речевых технологий как пример того, как встраивать психоакустическую меру прямо в обучение улучшения аудио. Авторы берут AERO-подобную сверхразрешающую модель, заменяют тяжелые блоки на Mamba и добавляют дифференцируемую реализацию PAQM. Интерес здесь не только в росте субъективных оценок, но и в том, что модель становится намного дешевле на выводе.

Метод. Базовый AERO использует рекуррентные и attention-подобные блоки для восстановления высоких частот. AEROMamba заменяет эту часть на state-space модель Mamba, а AEROMamba P добавляет к функции потерь член PAQM, который оптимизирует не спектральную близость как таковую, а психоакустически мотивированную оценку качества. Для MP3 32 kbps авторы вводят вариант AEROMamba P-S, где STFT reconstruction loss фактически заменяется PAQM loss, сохраняя adversarial и feature matching компоненты.

Результаты. На 10-секундном фрагменте AERO требует 17091 МБ видеопамяти и 1.246 с вывода, тогда как AEROMamba требует 3000 МБ и 0.087 с, то есть почти 14-кратное ускорение при близком числе параметров. На MUSDB при восстановлении 11.025 кГц до 44.1 кГц AEROMamba P получает субъективный score 79.26 против 60.03 у AERO и 66.47 у AEROMamba. Для MP3 32 kbps на MUSDB вариант P-S получает score 75.6, тогда как AEROMamba и AEROMamba P остаются около 49.8 и 49.7.

Ограничения. Это общая аудиоработа, а не специализированное улучшение речи с PESQ/STOI на речевых наборах. PAQM как оптимизационная цель ведет себя не везде одинаково: на PianoEval добавление PAQM-HQ не дает лучшую субъективную оценку. Есть риск подгонки под выбранную психоакустическую метрику, поэтому для речи нужны отдельные тесты на разборчивость, задержку и артефакты после распознавания.

Фишка из статьи. Самое ценное - отрицательный результат рядом с сильным ускорением. Mamba дает вычислительный выигрыш почти без оговорок, а PAQM-loss помогает на сложной музыке и MP3, но на фортепиано может быть лишним.

СценарийМодельVRAMВремя на 10 сСубъективный score
ЭффективностьAERO17091 МБ1.246 с-
ЭффективностьAEROMamba3000 МБ0.087 с-
MUSDB bandwidth extensionAERO--60.03
MUSDB bandwidth extensionAEROMamba P--79.26
MUSDB MP3 32 kbpsAEROMamba P-S--75.6

Как это читать: психоакустическая loss не является магической заменой всех спектральных потерь. Она особенно полезна там, где артефакты слышны как кодековые или широкополосные искажения, но требует проверки на конкретном домене, например на речи с последующим распознаванием.

Оригинальная статья на arXiv