Audio captions Оценка качества LLM judge
Оценка качества

Оценка структурированных аудиоописаний через контролируемые ошибки

499 clips

Работа про structured audio captions важна для аудиоязыковых моделей: плоская текстовая подпись уже не описывает все, что модель должна понимать в звуке. Авторы предлагают оценивать не один caption, а 15 полей: источники, действия, причины, громкость, основной тон, активные интервалы и спектральный профиль. Главный ход - проверять метрики controlled perturbations, то есть заранее внесенными ошибками известного типа и силы.

Метод. На основе AudioCards берется 499 sound-effect клипов из 57 UCS categories и 136 subcategories. 15 полей группируются в пять осей: tag-set, description, reasoning, numeric и spectral. Текстовые поля оцениваются LLM-as-a-judge, числовые и спектральные - детерминированными метриками; затем в ground truth вводятся paraphrase, acoustic, attribute и hallucination perturbations с тремя уровнями severity.

Результаты. В текстовых полях LLM-judge лучше сохраняет высокий score на paraphrase и монотонно снижает оценку на настоящих acoustic/attribute/hallucination ошибках. Для чисел нормированные ошибки ведут себя пропорционально severity, а ordinal spectral score оказывается полезнее точного совпадения по полосам, которое слишком резко падает при малых отклонениях. В сравнении judge-моделей Qwen3-4B имеет корреляцию r=0.983 с Qwen2.5-7B и требует 10.44 ГБ памяти против 17.35 ГБ у 7B.

Ограничения. Корпус состоит из sound effects, а не из реальных длинных аудиосцен, речи или музыкальных смесей, поэтому перенос на разговорные аудиологги надо проверять отдельно. LLM-судья стоит дороже n-gram или embedding-метрик и может ломаться на строгом формате вывода. Маленькая Qwen2.5-0.5B в статье валидно отвечает только в 23% случаев, что показывает хрупкость автоматической оценки.

Фишка из статьи. Самая инженерная часть - сравнение judge-моделей: маленькая модель дешевая, но форматно ненадежная, а 4B-модель почти совпадает с 7B baseline при заметно меньшей памяти.

Judge models/cardJ/cardPeak memValid
Qwen2.5-0.5B0.861751.55 GB23%
Qwen2.5-7B1.3141517.35 GB100%
Qwen3-4B1.4142210.44 GB100%
Llama-3-8B1.7455618.73 GB100%

Как это читать: экономия памяти у 0.5B бесполезна, если JSON валиден только в 23% случаев. Практический компромисс в статье - Qwen3-4B: он держит 100% valid и коррелирует с 7B baseline на r=0.983.

Оригинальная статья на arXiv