TORUS: проверка самосогласованности unified audio models
TORUS вводит полезный тест для универсальных аудиомоделей: если модель может генерировать звук, редактировать его и отвечать на вопросы, понимает ли она собственный результат? Это отличается от обычной оценки, где генерацию, редактирование и понимание проверяют отдельно. Авторы показывают, что современные unified audio models могут звучать приемлемо, но плохо согласовывать рендеринг и понимание.
Метод. Бенчмарк состоит из 48 трехэтапных тестов: сначала модель генерирует звук, затем редактирует его, затем выполняет контрфактическое редактирование. После каждого этапа задаются вопросы с шестью вариантами ответа; всего получается 432 вопроса. Задания покрывают речь, звуки и музыку. Для контроля авторы вводят проверки на утечки, "muted-audio" и "ideal-generation" solver gates, а также сравнивают с каскадом специализированных систем генерации, редактирования и понимания.
Результаты. Лучший unified вариант, Audex-30B, отвечает правильно на 50.5% вопросов, тогда как каскад специализированных моделей дает 63.2%, а случайный выбор равен 16.7%. Audio-Omni native получает 42.8%, Audio-Omni self-caption 43.3%, Audex-2B 35.4%, UniAudio-2 23.4%, Unified-IO 2 21.8%. Особенно проседают этапы с редактированием: например, у Audio-Omni native Stage 1 равен 50.7%, Stage 2 37.5%, Stage 3 40.3%. При этом human A/B preference не выглядит столь плохо: Audio-Omni выигрывает у каскада в 54.3% сравнений, Audex-30B в 51.4%.
Ограничения. Это англоязычный бенчмарк с шестью вариантами ответа, поэтому он измеряет конкретный формат понимания, а не все возможные аудиозадачи. Набор unified моделей пока небольшой. Для self-caption режимов часть результата может зависеть от качества промежуточного текстового описания. Каскадный baseline сам по себе использует сильные внешние компоненты и не является "идеальной истиной".
Фишка из статьи. Самое сильное место TORUS - разрыв между субъективным качеством звука и самосогласованностью. Модель может нравиться слушателям, но все равно не отвечать правильно на вопросы о том, что сама сгенерировала или отредактировала.
| Система | Self-coherence total | CM | WER | Human preference против каскада |
|---|---|---|---|---|
| Cascaded baseline | 63.2% | 59.0% | 0.0 | опорная система |
| Audex-30B | 50.5% | 59.7% | 1.270 | 51.4% |
| Audio-Omni native | 42.8% | 58.3% | 1.115 | 54.3% |
| Unified-IO 2 | 21.8% | нет в таблице | 0.952 | не основной результат |
Как это читать: Audio-Omni может чаще нравиться людям в парных сравнениях, но его self-coherence total на 20.4 п.п. ниже каскада. Значит, хорошая акустическая правдоподобность не гарантирует, что единая аудиомодель внутренне связала действие редактирования, получившийся сигнал и ответ на вопрос.