Оценка структурированных аудиоописаний через контролируемые ошибки
Работа про structured audio captions важна для аудиоязыковых моделей: плоская текстовая подпись уже не описывает все, что модель должна понимать в звуке. Авторы предлагают оценивать не один caption, а 15 полей: источники, действия, причины, громкость, основной тон, активные интервалы и спектральный профиль. Главный ход - проверять метрики controlled perturbations, то есть заранее внесенными ошибками известного типа и силы.
Метод. На основе AudioCards берется 499 sound-effect клипов из 57 UCS categories и 136 subcategories. 15 полей группируются в пять осей: tag-set, description, reasoning, numeric и spectral. Текстовые поля оцениваются LLM-as-a-judge, числовые и спектральные - детерминированными метриками; затем в ground truth вводятся paraphrase, acoustic, attribute и hallucination perturbations с тремя уровнями severity.
Результаты. В текстовых полях LLM-judge лучше сохраняет высокий score на paraphrase и монотонно снижает оценку на настоящих acoustic/attribute/hallucination ошибках. Для чисел нормированные ошибки ведут себя пропорционально severity, а ordinal spectral score оказывается полезнее точного совпадения по полосам, которое слишком резко падает при малых отклонениях. В сравнении judge-моделей Qwen3-4B имеет корреляцию r=0.983 с Qwen2.5-7B и требует 10.44 ГБ памяти против 17.35 ГБ у 7B.
Ограничения. Корпус состоит из sound effects, а не из реальных длинных аудиосцен, речи или музыкальных смесей, поэтому перенос на разговорные аудиологги надо проверять отдельно. LLM-судья стоит дороже n-gram или embedding-метрик и может ломаться на строгом формате вывода. Маленькая Qwen2.5-0.5B в статье валидно отвечает только в 23% случаев, что показывает хрупкость автоматической оценки.
Фишка из статьи. Самая инженерная часть - сравнение judge-моделей: маленькая модель дешевая, но форматно ненадежная, а 4B-модель почти совпадает с 7B baseline при заметно меньшей памяти.
| Judge model | s/card | J/card | Peak mem | Valid |
|---|---|---|---|---|
| Qwen2.5-0.5B | 0.86 | 175 | 1.55 GB | 23% |
| Qwen2.5-7B | 1.31 | 415 | 17.35 GB | 100% |
| Qwen3-4B | 1.41 | 422 | 10.44 GB | 100% |
| Llama-3-8B | 1.74 | 556 | 18.73 GB | 100% |
Как это читать: экономия памяти у 0.5B бесполезна, если JSON валиден только в 23% случаев. Практический компромисс в статье - Qwen3-4B: он держит 100% valid и коррелирует с 7B baseline на r=0.983.