оценка качества улучшение речи устойчивость метрик
arXiv eess.AS

Рост предсказанного MOS без улучшения слышимого качества: оптимизация улучшенной речи по нескольким оценщикам во время применения

arXiv:2609.39028

Работа демонстрирует прямую атаку на распространённый протокол оценки улучшения речи: выход можно подправить так, чтобы сразу несколько безэталонных MOS-предикторов поставили более высокий балл, а люди не услышали улучшения. Это не абстрактный состязательный пример — оптимизированная система заметно поднимается в рейтинге реального испытания URGENT 2026.

Метод. К улучшенному сигналу добавляется небольшое обучаемое возмущение, совместно оптимизируемое по DNSMOS, NISQA, UTMOS и SCOREQ с ограничением на величину изменения. Авторы проверяют семь систем на 1023 репликах, оценивают перенос на не участвовавший в оптимизации Distill-MOS и проводят MUSHRA для исходных и изменённых сигналов.

Результаты. При коэффициенте ограничения 0,005 целевые оценки растут, тогда как эталонные метрики меняются не более чем на 0,01, а Distill-MOS — не более чем на 0,03. В MUSHRA сильная система RICK превосходит baird на 8,48 балла, но оптимизация baird меняет результат всего на −0,22 балла при p=0,81; для RICK изменение −0,65 при p=0,47.

Ограничения. Субъективный тест охватывает десять реплик и 11 отфильтрованных слушателей. Исследование проведено на одном испытании и аддитивном типе оптимизации; оно показывает уязвимость конкретных оценщиков, но не доказывает отсутствие любого воспринимаемого эффекта в иных условиях.

Фишка из статьи. Практический ущерб виден не по абсолютному MOS, а по перестановке систем. Базовый сигнал, который без оптимизации не прошёл бы в субъективный этап, при более сильном возмущении оказывается выше порога, хотя сама система улучшения не изменилась.

СистемаДо оптимизацииПосле оптимизацииНастройка
RICK6-е место3-е местоλ = 0,005
Базовая система13-е место6-е местоλ = 0,05
baird, MUSHRAИсходный уровень−0,22 баллаλ = 0,005

Как это читать: оптимизация меняет решение организатора о допуске системы, но не даёт соответствующего прироста в человеческом прослушивании; средний ансамбль предикторов поэтому нельзя считать защитой от подгонки.

Оригинальная статья на arXiv