Оценка качества речи Локальные искажения MOS
arXiv cs.SD

DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization

arXiv:2608.21176

DAMOS исходит из наблюдения, что общую оценку речи часто портит короткий локальный дефект, тогда как обучение по одному MOS на всю запись не говорит модели, где его искать. Авторы создают отдельную задачу локализации искажений и используют её как вспомогательное знание для оценки качества. Наиболее интересен не небольшой выигрыш внутри BVCC, а устойчивый перенос на наборы с телефонией, шумом, синтезом и реальными записями.

Метод. Синтетический корпус содержит 15 тыс. реплик, куда вставлены от одного до трёх непересекающихся дефектов длительностью 0,5-3 с: кодирование, реверберация, шумы, обрезание, потеря пакетов, случайная фаза, растяжение времени, ошибки вокодера и их сочетания. Для кадров по 160 мс автоматически известна двоичная маска. Замороженный Boundary-Aware Model предсказывает эту маску, а DAMOS поверх WavLM-Large последовательно выбирает полезные скрытые слои, модулирует признаки маской через DistortionFiLM и только затем оценивает покадровое качество с усреднением в MOS.

Результаты. На BVCC из 4974/1066/1066 примеров DAMOS получает MSE 0,191 и ранговую корреляцию SRCC 0,885 против 0,408 и 0,878 у UTMOS; на уровне систем SRCC равна 0,931. При обучении только на BVCC средняя SRCC по семи внешним наборам достигает 0,746 против 0,718 у UTMOS и 0,694 у SSL-MOS. Локализатор на своём синтетическом тесте даёт покадровую F1 0,807 при точности 0,903, а для границ дефекта - F1 0,742. Удаление выбора скрытых слоёв сильнее всего портит BVCC: SRCC падает до 0,853.

Ограничения. Границы искажений полностью синтетические, а устойчивость к естественным ошибкам локализатора на реальных дефектах не измерена. Локализатор и оценщик MOS обучаются раздельно, первый заморожен. Основа WavLM-Large делает систему тяжёлой, но число параметров, память и скорость не приведены. Внутренние сравнения на нескольких наборах требуют отдельного обучения на каждом из них; только таблица переноса действительно проверяет работу без дообучения. Результат остаётся одним числом MOS и пока не объясняет пользователю, какой найденный участок снизил оценку.

Фишка из статьи. Неожиданно, во время применения модели маску можно почти полностью убрать: нулевая маска едва меняет BVCC. Гораздо опаснее ложное указание, что искажена вся запись. Значит, локализация работает не только как входной признак, но и как обучающая регуляризация представления; редкие пропуски дефектов терпимее массовых ложных срабатываний.

НаборМаскаMSESRCCLCC
BVCCпредсказанная0,1910,8850,884
BVCCвезде чисто0,1910,8840,884
BVCCвезде искажено0,2270,8700,872
TCD-VoIPпредсказанная / везде чисто / везде искажено0,300 / 0,304 / 0,3740,837 / 0,829 / 0,8180,858 / 0,858 / 0,845

Как это читать: отсутствие подсказки почти безвредно на BVCC, но заведомо ложная положительная маска заметно хуже. Практический приоритет для локализатора - высокая точность срабатывания, даже ценой умеренно низкой полноты; именно такой профиль, точность 0,963 при полноте 0,695, авторы и получают.

Оригинальная статья на arXiv