Deep Neural Compression for RIR-Characterized Acoustic Environments with Structure-Aware Constraints
Авторы сжимают не речь, а импульсную характеристику помещения, сохраняя те свойства, которые слышны после свёртки с речью. Обычный звуковой кодек плохо подходит для этой задачи: малая ошибка формы импульса ещё не гарантирует верное время реверберации, отношение прямого и отражённого звука или спектральный окрас.
Метод. Кодек типа EnCodec обучается на монофонических RIR с потерями по кривой затухания энергии, прямой, ранней и поздней части отклика, а также по уже реверберированной речи. Набор содержит 106 240 одноканальных откликов из 830 конфигураций одной комнаты; основной режим работает на 24 кГц и 375 бит/с.
Результаты. Предложенная модель снижает относительную ошибку T60 до 1,14% против 5,04% у речевого EnCodec и 2,49% у EnCodec, переобученного на RIR. Ошибка DRR равна 5,11 против 16,99 и 29,11, ViSQOL реверберированной речи — 4,11 против 3,44 и 3,23, а субъективный MOS — 4,28 против 3,00 и 2,32.
Ограничения. Все отклики получены в одной комнате, а многоканальная согласованность не моделируется: каналы пришлось бы кодировать независимо. Не проверены движущиеся источники, изменяющаяся акустика и перенос на реальные измерительные тракты. Субъективная оценка относится к ограниченному набору условий.
Фишка из статьи. Снижение скорости почти до 94 бит/с проходит без заметной потери ViSQOL, но ещё одно деление пополам разрушает параметры реверберации.
| Скорость, бит/с | ViSQOL | Ошибка T60, % |
|---|---|---|
| 375 | 4,11 | 1,14 |
| 187,5 | 4,14 | небольшая |
| 93,75 | 4,15 | 1,53 |
| 46,875 | 3,98 | 8,89 |
Как это читать: у кодека есть выраженное «колено» около 94 бит/с. Ниже него слуховая оценка снижается умеренно, но физически важное время реверберации уже кодируется существенно хуже.