частотно-временной анализ вокальные ансамбли оценка высоты тона
arXiv cs.SD

Линейная STFT против HCQT для оценки нескольких высот тона в вокальных ансамблях

arXiv:2610.03656

Для оценки нескольких одновременно звучащих голосов обычно выбирают HCQT: логарифмическая частотная сетка и гармонические каналы кажутся естественным способом развести близкие основные частоты. Эта работа показывает полезный контрпример: обычная линейная STFT не только заметно дешевле при генерации смесей на лету, но и устойчиво точнее на пяти наборах вокальных ансамблей.

Метод. Авторы оставляют одинаковыми свёрточный вход, 360 выходных высот с шагом 20 центов и кодировщик, меняя только входное представление. HCQT сравнивается с логарифмом модуля STFT: окно 2048 отсчётов, шаг 256, первые 360 линейных частотных отсчётов до 7,7 кГц. Проверены пять кодировщиков примерно на 19 млн параметров и 133,3 часа обучающих вокальных дорожек на нескольких языках.

Результаты. При одинаковом ConvNeXt точность точного совпадения высоты выросла с 0,648 до 0,683 на jaCappella, с 0,492 до 0,533 на ACappellaSet и с 0,584 до 0,614 на корейском наборе. По 2894 проверочным фрагментам абсолютный прирост F1 составил 0,020 с парным 95%-м интервалом [0,018; 0,022]. Лучшим оказалось окно 46 мс: и более короткие, и более длинные окна ухудшали результат; расширение диапазона выше 7,7 кГц также не помогло.

Ограничения. Эталонные F0 в основном получены автоматически с помощью pYIN, поэтому ошибки разметки могут влиять на выводы. Большинство смесей составлено из независимо записанных дорожек и не воспроизводит акустические и интонационные взаимодействия общего помещения; на совместно записанных хорах преимущество менее однозначно. Вывод пока относится к пению, а не к речи и не ко всем музыкальным инструментам.

Фишка из статьи. Выигрыш линейной STFT объясняется не более точной локализацией частоты: HCQT даёт сопоставимую ошибку высоты. Важнее оказался доступ к верхним гармоникам за пределами диапазона предсказываемых F0, тогда как привычное увеличение частотного разрешения само по себе не помогает.

Представление, ConvNeXtjaCappella, 20 центовACappellaSetКорейский наборChoralSynth
HCQT0,6480,4920,5840,638
Линейная STFT0,6830,5330,6140,657
Разница+0,035+0,041+0,030+0,019

Как это читать: линейная сетка выигрывает на всех четырёх приведённых наборах, но эффект не огромен. Практический вывод сильнее средней прибавки: дорогое гармонически выровненное представление здесь не оправдывает вычислительную цену.

Оригинальная статья на arXiv