VocalCoachBench: Benchmarking Audio-Language Models on Expert Feedback for Singing
VocalCoachBench проверяет, может ли звуковая языковая модель не просто поставить певцу балл, а найти конкретную проблему и дать уместное упражнение. Набор особенно ценен тем, что не маскирует расхождения между преподавателями: жёстко оцениваются только согласованные категории и сравнения, а свободные советы раскладываются на отдельные диагностические и корректирующие утверждения.
Метод. В наборе 515 записей, оценки 18 профессиональных преподавателей, 1056 экспертных разборов и 12 051 атомарное утверждение. Часть записей позволяет сравнивать три исполнения одной песни, другая охватывает разные песни и размеченные временные отрезки. Двенадцать моделей проходят ранжирование, выбор трёх проблем, классификацию 262 согласованных фрагментов и проверку свободного ответа по отдельным утверждениям.
Результаты. В попарном сравнении исполнений Qwen2.5-Omni достигает 68,7% среди открытых моделей, а Qwen3.5-Omni Plus — 74,5% среди закрытых. Но ни одна модель не превосходит частотное правило без звука по тонкой F1@3: 62,4% у правила против максимумов 44,6% и 50,1%. Строгое совпадение диагноза с экспертным утверждением остаётся ниже 7%, хотя совпадение на более общем уровне доходит до 63,2%.
Ограничения. Свободные ответы оценивает языковая модель, хотя проверка на людях дала согласие 83,4% для диагнозов и 79,2% для советов. Эксперты сами расходятся: F1@3 между ними равна 0,579 на тонких метках и 0,771 на крупных категориях. Высокая доля «правильных» советов не доказывает точный слуховой диагноз, а перенос на иные школы вокала и языки отдельно не исследован.
Фишка из статьи. Таблица вскрывает разрыв между правдоподобным советом и точной диагностикой: модель может почти всегда выдать педагогически допустимую коррекцию, но редко назвать ту конкретную проблему, которую выделил преподаватель.
| Модель | Попарное сравнение, % | F1@3 проблем, % | Строгий диагноз, % | Диагноз до крупной категории, % | Допустимый совет, % |
|---|---|---|---|---|---|
| Qwen2.5-Omni | 68,7 | 38,6 | 3,1 | 63,2 | 31,7 |
| Fun-Audio-Chat | 49,3 | 44,6 | 4,7 | 58,8 | 88,8 |
| Gemini 3 Flash Preview | 71,2 | 50,1 | 1,4 | 32,2 | 78,3 |
| Qwen3.5-Omni Plus | 74,5 | 32,8 | 6,9 | 53,4 | 98,4 |
Как это читать: 98,4% допустимых советов у Qwen3.5-Omni Plus соседствуют лишь с 6,9% строгих попаданий в диагноз. Это означает, что общая рекомендация вроде работы над опорой может звучать разумно, не будучи привязанной к приоритетной ошибке в конкретной записи.