оценка качества ансамбли неопределённость
arXiv eess.AS

Ансамблевая оценка воспринимаемого качества аудио с доверительными интервалами

arXiv:2610.06569

Большинство автоматических оценщиков качества выдаёт одно число и тем самым скрывает неопределённость на незнакомых искажениях. Авторы строят лёгкий ансамбль по 11 признакам PEAQ и калибруют распределение прогнозов, чтобы вместе с оценкой качества получать доверительный интервал.

Метод. Нелинейные регрессоры MARS обучаются бутстрэпом на открытом наборе SEBASS с 11 000 субъективных оценок. Разброс ансамбля затем калибруется по отложенным данным и используется для интервалов и попарных тестов. Это заметно компактнее сравниваемой глубокой модели GML на 15,25 млн параметров, обученной на закрытом наборе из 67 505 оценок.

Результаты. На SAOC корреляция Пирсона составляет 0,93 при RMSE 5,2, на SASSEC — 0,97 и 4,4, на SiSEC08 — 0,96 и 4,6. На сложных наборах USAC корреляция лежит от 0,78 до 0,94. Калибровка почти не меняет точечную точность, но поднимает фактическое покрытие 95%-х интервалов, например с 0,30 до 0,82 на SAOC и с 0,31 до 0,75 на SASSEC.

Ограничения. Даже после калибровки заявленное покрытие 0,95 нигде не достигается; на USAC оно остаётся лишь 0,33–0,43. Авторы прямо признают, что статистическая значимость различий между двумя аудиосистемами пока определяется ненадёжно: снижение ложных срабатываний сопровождается потерей чувствительности.

Фишка из статьи. Работа показывает редкий для метрик качества отрицательный результат: хороший доверительный интервал для отдельной записи ещё не делает надёжным попарное сравнение систем.

НаборПокрытие до калибровкиПосле калибровкиЦелевое
SAOC0,300,820,95
SASSEC0,310,750,95
SiSEC080,280,690,95
USAC10,140,330,95
USAC20,200,430,95

Как это читать: калибровка исправляет наиболее самоуверенные интервалы, но сильный сдвиг домена всё ещё ломает вероятностную интерпретацию. Такие интервалы полезны как предупреждение, а не как готовый критерий статистической победы одной системы над другой.

Оригинальная статья на arXiv