Вокал Music MIR F0
arXiv cs.SD

Pansori mode classification: частотно-высотные и тембровые признаки вокальной традиции

arXiv:2608.06633

Статья переносит классификацию ладов Pansori из нотного анализа в покадровый анализ вокального аудио. Задача интересна для речевых и музыкальных технологий тем, что лад здесь задается не только высотным набором, но и микротональной орнаментикой, тембром и ударным сопровождением. Авторы строят 46-часовую экспертную разметку и сравнивают mel-спектрограммы, F0-контур, MIDI piano roll и CultureMERT.

Метод. Пять канонических batang размечены профессиональным исполнителем Pansori на уровне кадров; модели предсказывают четыре класса: Ujo, Gyemyeonjo, Aniri и Changjo. Mel-Original работает по исходному звуку, Mel-Sep - по вокалу после разделения источников, F0-модель использует PESTO и Conv1DGRU, MIDI-вариант переводит высотный контур в piano-roll, а CultureMERT проверяет универсальное самоконтролируемое музыкальное представление. Два split-режима отделяют обычную проверку от строгого work-level переноса.

Результаты. Лучший общий masked macro-F1 дает Mel-Original: 0.871 на Daemok-Shared и 0.785 на Work-level. По трем хорошо представленным модам разрыв между split-режимами составляет только 2.1-3.6 F1-пункта, что говорит против простого запоминания произведений. Но Changjo ломает macro-F1: его доля всего 1.8% размеченных кадров, а при разделении источников F1 по Changjo падает с 0.831 до 0.632 на Daemok-Shared и с 0.571 до 0.504 на Work-level.

Ограничения. Это культурно специфичный вокальный корпус, и результаты нельзя прямо переносить на другие традиции или обычную речь. Классы сильно несбалансированы, особенно Changjo, поэтому macro-F1 чувствителен к редким режимам. Кроме того, универсальное предобучение CultureMERT оказывается слабым на различении Ujo и Gyemyeonjo, что ограничивает надежду на «готовые» музыкальные признаки.

Фишка из статьи. Самая интересная DSP/MIR-деталь: разделение источников помогает выделить вокал, но удаляет ударный cue, который нужен для Changjo. То есть стандартная предобработка «очистим вокал» может убрать музыкально значимый признак.

ПредставлениеMacro-F1 sharedChangjo sharedMacro-F1 work-levelChangjo work-level
Mel-Original0.8710.8310.7850.571
Mel-Sep0.8210.6320.7620.504
F00.7430.5080.6830.343
MIDI0.6890.4190.6260.233
CultureMERT0.6960.5510.5390.175

Как это читать: Mel-Sep почти не хуже Mel-Original для Ujo, Gyemyeonjo и Aniri, но резко хуже для Changjo. Это указывает не на общую слабость source separation, а на конкретную потерю барабанного контекста, который является частью определения класса.

Оригинальная статья на arXiv