анализ пения звуковые языковые модели экспертная оценка
arXiv cs.SD

VocalCoachBench: Benchmarking Audio-Language Models on Expert Feedback for Singing

arXiv:2609.04241

VocalCoachBench проверяет, может ли звуковая языковая модель не просто поставить певцу балл, а найти конкретную проблему и дать уместное упражнение. Набор особенно ценен тем, что не маскирует расхождения между преподавателями: жёстко оцениваются только согласованные категории и сравнения, а свободные советы раскладываются на отдельные диагностические и корректирующие утверждения.

Метод. В наборе 515 записей, оценки 18 профессиональных преподавателей, 1056 экспертных разборов и 12 051 атомарное утверждение. Часть записей позволяет сравнивать три исполнения одной песни, другая охватывает разные песни и размеченные временные отрезки. Двенадцать моделей проходят ранжирование, выбор трёх проблем, классификацию 262 согласованных фрагментов и проверку свободного ответа по отдельным утверждениям.

Результаты. В попарном сравнении исполнений Qwen2.5-Omni достигает 68,7% среди открытых моделей, а Qwen3.5-Omni Plus — 74,5% среди закрытых. Но ни одна модель не превосходит частотное правило без звука по тонкой F1@3: 62,4% у правила против максимумов 44,6% и 50,1%. Строгое совпадение диагноза с экспертным утверждением остаётся ниже 7%, хотя совпадение на более общем уровне доходит до 63,2%.

Ограничения. Свободные ответы оценивает языковая модель, хотя проверка на людях дала согласие 83,4% для диагнозов и 79,2% для советов. Эксперты сами расходятся: F1@3 между ними равна 0,579 на тонких метках и 0,771 на крупных категориях. Высокая доля «правильных» советов не доказывает точный слуховой диагноз, а перенос на иные школы вокала и языки отдельно не исследован.

Фишка из статьи. Таблица вскрывает разрыв между правдоподобным советом и точной диагностикой: модель может почти всегда выдать педагогически допустимую коррекцию, но редко назвать ту конкретную проблему, которую выделил преподаватель.

МодельПопарное сравнение, %F1@3 проблем, %Строгий диагноз, %Диагноз до крупной категории, %Допустимый совет, %
Qwen2.5-Omni68,738,63,163,231,7
Fun-Audio-Chat49,344,64,758,888,8
Gemini 3 Flash Preview71,250,11,432,278,3
Qwen3.5-Omni Plus74,532,86,953,498,4

Как это читать: 98,4% допустимых советов у Qwen3.5-Omni Plus соседствуют лишь с 6,9% строгих попаданий в диагноз. Это означает, что общая рекомендация вроде работы над опорой может звучать разумно, не будучи привязанной к приоритетной ошибке в конкретной записи.

Оригинальная статья на arXiv