Music transcription Оценка аудио DSP
arXiv cs.SD

Двойная оценка транскрипции музыки: ноты отдельно, звучание отдельно

arXiv:2608.04511

Статья разбирает важную для аудио-оценки проблему: система транскрипции музыки может давать удобочитаемые ноты, но плохо воспроизводить исходное исполнение, или наоборот. Поэтому авторы разделяют две оси: сходство MusicXML-нотации с эталонной партитурой и сходство звучания после обратного рендера с исходной записью. Для речевых технологий это хороший пример того, как одна "общая" метрика может скрыть разные свойства сигнала и структуры.

Метод. Авторы оценивают 24 полных конвейера: восемь audio-to-MIDI моделей, скрещенных с тремя MIDI-to-score конвертерами. Нотная сторона измеряется через OMR Normalized Edit Distance, а звуковая - через рендер предсказанной партитуры и сравнение с исходной записью. Набор построен из ATEPP: 230 записей, 23 произведения, 6 композиторов и 30 исполнителей, записи ограничены тремя минутами. Человеческая проверка - ABX-прослушивание: 106 участников и 3180 валидных попарных суждений, агрегированных моделью Bradley-Terry.

Результаты. На стороне звучания лучше всего с человеческими предпочтениями совпадает CLEWS segment-mean: Spearman 0.971 и Kendall 0.891. Gemini 3.1 Pro почти рядом: 0.970 и 0.870, но дороже. Из классических DSP-метрик TWED по MFCC достигает 0.924/0.790, DTW по Chroma CENS - 0.891/0.761. Отдельный кейс Rubato показывает лучший OMR-NED 72.30 среди всех систем, но по CLEWS занимает только шестое место и не имеет человеческой оценки, потому что появился после завершения слушательского эксперимента.

Ограничения. Данные ограничены западной классической фортепианной музыкой, так что выводы нельзя напрямую переносить на вокал, ансамбли или шумные записи. Человеческая проверка оценивает сходство звучания, но не чтение нот музыкантами. Кроме того, оценка зависит от рендера MusicXML обратно в звук: ошибки рендера могут смешиваться с ошибками транскрипции.

Фишка из статьи. Таблица стоимости показывает практический смысл выбора метрики: CLEWS почти не уступает дорогому аудио-языковому судье по корреляции, но стоит существенно меньше.

ОценщикSpearmanKendallНормированная стоимость
CLEWS segment-mean0.9710.891$0.370 / 1000 единиц
Gemini 3.1 Pro ABX0.9700.870$5.100 / 1000 единиц
TWED-MFCC0.9240.790$1.760 / 1000 единиц
DTW Chroma CENS0.8910.761$0.610 / 1000 единиц

Как это читать: у CLEWS лучшая корреляция с людьми и низкая стоимость. Это делает его более инженерно разумным выбором для массовой оценки, чем полноценный ABX-судья на большой модели.

Оригинальная статья на arXiv