Audio models Benchmark Самосогласованность
Оценка аудиомоделей

TORUS: проверка самосогласованности unified audio models

432 вопроса

TORUS вводит полезный тест для универсальных аудиомоделей: если модель может генерировать звук, редактировать его и отвечать на вопросы, понимает ли она собственный результат? Это отличается от обычной оценки, где генерацию, редактирование и понимание проверяют отдельно. Авторы показывают, что современные unified audio models могут звучать приемлемо, но плохо согласовывать рендеринг и понимание.

Метод. Бенчмарк состоит из 48 трехэтапных тестов: сначала модель генерирует звук, затем редактирует его, затем выполняет контрфактическое редактирование. После каждого этапа задаются вопросы с шестью вариантами ответа; всего получается 432 вопроса. Задания покрывают речь, звуки и музыку. Для контроля авторы вводят проверки на утечки, "muted-audio" и "ideal-generation" solver gates, а также сравнивают с каскадом специализированных систем генерации, редактирования и понимания.

Результаты. Лучший unified вариант, Audex-30B, отвечает правильно на 50.5% вопросов, тогда как каскад специализированных моделей дает 63.2%, а случайный выбор равен 16.7%. Audio-Omni native получает 42.8%, Audio-Omni self-caption 43.3%, Audex-2B 35.4%, UniAudio-2 23.4%, Unified-IO 2 21.8%. Особенно проседают этапы с редактированием: например, у Audio-Omni native Stage 1 равен 50.7%, Stage 2 37.5%, Stage 3 40.3%. При этом human A/B preference не выглядит столь плохо: Audio-Omni выигрывает у каскада в 54.3% сравнений, Audex-30B в 51.4%.

Ограничения. Это англоязычный бенчмарк с шестью вариантами ответа, поэтому он измеряет конкретный формат понимания, а не все возможные аудиозадачи. Набор unified моделей пока небольшой. Для self-caption режимов часть результата может зависеть от качества промежуточного текстового описания. Каскадный baseline сам по себе использует сильные внешние компоненты и не является "идеальной истиной".

Фишка из статьи. Самое сильное место TORUS - разрыв между субъективным качеством звука и самосогласованностью. Модель может нравиться слушателям, но все равно не отвечать правильно на вопросы о том, что сама сгенерировала или отредактировала.

СистемаSelf-coherence totalCMWERHuman preference против каскада
Cascaded baseline63.2%59.0%0.0опорная система
Audex-30B50.5%59.7%1.27051.4%
Audio-Omni native42.8%58.3%1.11554.3%
Unified-IO 221.8%нет в таблице0.952не основной результат

Как это читать: Audio-Omni может чаще нравиться людям в парных сравнениях, но его self-coherence total на 20.4 п.п. ниже каскада. Значит, хорошая акустическая правдоподобность не гарантирует, что единая аудиомодель внутренне связала действие редактирования, получившийся сигнал и ответ на вопрос.

Оригинальная статья на arXiv