импульсные характеристики акустика помещений сжатие
arXiv eess.AS

Deep Neural Compression for RIR-Characterized Acoustic Environments with Structure-Aware Constraints

arXiv:2609.04085

Авторы сжимают не речь, а импульсную характеристику помещения, сохраняя те свойства, которые слышны после свёртки с речью. Обычный звуковой кодек плохо подходит для этой задачи: малая ошибка формы импульса ещё не гарантирует верное время реверберации, отношение прямого и отражённого звука или спектральный окрас.

Метод. Кодек типа EnCodec обучается на монофонических RIR с потерями по кривой затухания энергии, прямой, ранней и поздней части отклика, а также по уже реверберированной речи. Набор содержит 106 240 одноканальных откликов из 830 конфигураций одной комнаты; основной режим работает на 24 кГц и 375 бит/с.

Результаты. Предложенная модель снижает относительную ошибку T60 до 1,14% против 5,04% у речевого EnCodec и 2,49% у EnCodec, переобученного на RIR. Ошибка DRR равна 5,11 против 16,99 и 29,11, ViSQOL реверберированной речи — 4,11 против 3,44 и 3,23, а субъективный MOS — 4,28 против 3,00 и 2,32.

Ограничения. Все отклики получены в одной комнате, а многоканальная согласованность не моделируется: каналы пришлось бы кодировать независимо. Не проверены движущиеся источники, изменяющаяся акустика и перенос на реальные измерительные тракты. Субъективная оценка относится к ограниченному набору условий.

Фишка из статьи. Снижение скорости почти до 94 бит/с проходит без заметной потери ViSQOL, но ещё одно деление пополам разрушает параметры реверберации.

Скорость, бит/сViSQOLОшибка T60, %
3754,111,14
187,54,14небольшая
93,754,151,53
46,8753,988,89

Как это читать: у кодека есть выраженное «колено» около 94 бит/с. Ниже него слуховая оценка снижается умеренно, но физически важное время реверберации уже кодируется существенно хуже.

Оригинальная статья на arXiv