Оценка качества Flow Matching DSP
arXiv cs.SD

InvFlowFD: оценка качества аудио без референса и фонового набора

arXiv:2608.04142

InvFlowFD предлагает метрику качества музыки без чистого референса и без фонового набора, который нужен Fréchet Audio Distance. Идея полезна шире, чем музыка: многие речевые и аудио-системы генерируют сигнал в условиях, где нет парного эталона, а выбор background set сильно меняет результат. Авторы используют инверсию модели flow matching как способ измерить, насколько аудио похоже на распределение хорошей музыки.

Метод. В качестве основы берется JASCO-400M, unconditional flow matching модель, обученная примерно на 20 тысячах часов музыки. Для оцениваемого 10-секундного фрагмента InvFlowFD выполняет обратную траекторию к шумовому пространству и измеряет расстояние от ожидаемого prior. В экспериментах авторы используют MTG-Jamendo и FMA-small, а искусственные искажения включают белый шум, низко- и высокочастотные фильтры, а также crop-and-paste дефект: локальные вставки в частотных полосах, имитирующие сбои генеративных моделей.

Результаты. На обычных фильтрах InvFlowFD ведет себя монотонно: растет с усилением белого шума и высокочастотного фильтра, падает при ослаблении низкочастотного среза. В человеческом парном исследовании собрано 400 ответов от 8 оценщиков, по 3-5 ответов на пару уровней искажения. Для crop-and-paste, где нарушается локальная временная структура музыки, InvFlowFD достигает Pearson r = 0.73 с человеческой оценкой; FAD на двух фоновых наборах дает -0.87 и 0.43, то есть может даже менять знак вывода.

Ограничения. Метрика проверена на музыке, а не на речи, поэтому перенос на улучшение речи, кодеки или синтез голоса нужно доказывать отдельно. Человеческое исследование небольшое и построено на синтетических искажениях. Кроме того, метрика наследует область применимости JASCO: если тестовое аудио сильно отличается от обучающего распределения, значение может отражать доменный сдвиг, а не только субъективное качество.

Фишка из статьи. Crop-and-paste искажение - удачная проверка именно временной связности, а не только спектральной чистоты.

МетрикаНужен фоновой наборPearson r на crop-and-pasteВывод
InvFlowFDНет0.73Хорошо согласуется с человеческой оценкой локальных сбоев
FAD, FMA-popДа-0.87Меняет направление вывода
FAD, MusicCapsДа0.43Частично согласуется, но слабее

Как это читать: проблема не только в том, что FAD иногда менее точен. Один и тот же FAD дает разные выводы в зависимости от фонового набора, а InvFlowFD пытается убрать этот внешний источник нестабильности.

Оригинальная статья на arXiv