оценка качества пространственный звук многоканальный звук
arXiv cs.SD

Оценка качества многоканального звука: перенос предобученных перцептивных моделей на пространственное звучание

arXiv:2609.37116

Работа показывает, как перенести замороженную модель качества для моно, стерео и бинаурального звука на формат 5.1, не сводя все каналы в один сигнал. Каналы объединяются в пространственные группы, а обучаемое внимание выбирает вклад каждой группы отдельно для разных перцептивных полос признаков.

Метод. Сравниваются предсказание по отдельным каналам, стандартное ITU-сведение, бинаурализация, объединение скрытых представлений и Feature-Band Group Attention. Основная GMLv2 заморожена; обучается только слой, который смешивает группы до перцептивной обработки.

Результаты. FGAtt получает общую корреляцию Пирсона 0,9063 и Спирмена 0,8303 на пяти наборах MUSHRA. Объединение скрытых представлений даёт 0,8875/0,7995, ITU-сведение 0,8623/0,7839, а объединение только итоговых предсказаний по группам 0,8131/0,7731.

Ограничения. Проверен только формат 5.1 без канала низкочастотных эффектов. Группировка каналов задана вручную, модель качества остаётся замороженной, а обобщение на Ambisonics, произвольные решётки и интерактивный звук не исследовано.

Фишка из статьи. Один вес на пространственную группу хуже веса для каждой полосы признаков. Ещё более детальное внимание внутри группы тоже ухудшает результат: важна именно адаптация между пространственными группами, а не максимальная дробность внимания.

ОбъединениеPCC ↑SCC ↑Число проходов основы
ITU-сведение0,86230,78391
Скрытые представления0,88750,7995по одному на группу
FGAtt по полосам0,90630,83031
FGAtt с одним весом на группу0,89120,81281

Как это читать: пространственная структура полезна до входа в перцептивную основу, а частотно-зависимые веса дают измеримый прирост без нескольких дорогих проходов GMLv2.

Оригинальная статья на arXiv