Оценка качества многоканального звука: перенос предобученных перцептивных моделей на пространственное звучание
Работа показывает, как перенести замороженную модель качества для моно, стерео и бинаурального звука на формат 5.1, не сводя все каналы в один сигнал. Каналы объединяются в пространственные группы, а обучаемое внимание выбирает вклад каждой группы отдельно для разных перцептивных полос признаков.
Метод. Сравниваются предсказание по отдельным каналам, стандартное ITU-сведение, бинаурализация, объединение скрытых представлений и Feature-Band Group Attention. Основная GMLv2 заморожена; обучается только слой, который смешивает группы до перцептивной обработки.
Результаты. FGAtt получает общую корреляцию Пирсона 0,9063 и Спирмена 0,8303 на пяти наборах MUSHRA. Объединение скрытых представлений даёт 0,8875/0,7995, ITU-сведение 0,8623/0,7839, а объединение только итоговых предсказаний по группам 0,8131/0,7731.
Ограничения. Проверен только формат 5.1 без канала низкочастотных эффектов. Группировка каналов задана вручную, модель качества остаётся замороженной, а обобщение на Ambisonics, произвольные решётки и интерактивный звук не исследовано.
Фишка из статьи. Один вес на пространственную группу хуже веса для каждой полосы признаков. Ещё более детальное внимание внутри группы тоже ухудшает результат: важна именно адаптация между пространственными группами, а не максимальная дробность внимания.
| Объединение | PCC ↑ | SCC ↑ | Число проходов основы |
|---|---|---|---|
| ITU-сведение | 0,8623 | 0,7839 | 1 |
| Скрытые представления | 0,8875 | 0,7995 | по одному на группу |
| FGAtt по полосам | 0,9063 | 0,8303 | 1 |
| FGAtt с одним весом на группу | 0,8912 | 0,8128 | 1 |
Как это читать: пространственная структура полезна до входа в перцептивную основу, а частотно-зависимые веса дают измеримый прирост без нескольких дорогих проходов GMLv2.