Оценка аудио Text-to-Audio Benchmark
arXiv cs.SD

AudioScape-TTA: детальная оценка генерации звука по тексту

arXiv:2608.04479

AudioScape-TTA закрывает слабое место генерации звука по тексту: глобальная близость текста и аудио плохо говорит, выполнены ли конкретные требования подсказки. Авторы строят бенчмарк с мелкими семантическими рубриками: какие события должны быть слышны, какие акустические атрибуты должны совпадать, есть ли речь и правильно ли передано ее содержание. Для речевых и аудио-систем это ценно как пример оценки не "похоже в целом", а "выполнены ли условия".

Метод. Каждый звуковой фрагмент размечается набором проверяемых требований, а оценщик отвечает на вопросы по сгенерированному аудио. В бенчмарке 2258 примеров, 25707 семантических рубрик, средняя длительность 9.95 секунды и в среднем 11.39 рубрики на пример. Отдельно выделены речевые случаи: 358 клипов с речевой аннотацией, 83 с целевыми высказываниями, 163 рубрики на содержание речи и 931 рубрика на речевые атрибуты.

Результаты. В сравнении 13 моделей лучшей по общей semantic satisfaction rate оказывается Foley-Omni: Overall SR 79.62%, Event Presence 81.74%, Event Attribute 78.34%. Dasheng AudioGen отдельно выделяется на речевом содержании: Speech Content SCCA@0.60 равен 77.30, тогда как у большинства моделей этот показатель нулевой, потому что они не генерируют явную речь. Авторы также проверяют надежность автоматического оценщика на контрастивном наборе из 452 пунктов: F1 94.88%, accuracy и balanced accuracy 94.91%, false-positive rate 4.42%.

Ограничения. Основной сигнал оценки зависит от аудио-языкового оценщика и от качества рубрик, а не от прямой человеческой разметки каждого сгенерированного клипа. Контрастивная проверка сбалансирована, но она Gemini-verified, а не полностью human-calibrated. Кроме того, метрика хорошо проверяет наличие заданных условий, но не является полноценной мерой лишних звуковых галлюцинаций.

Фишка из статьи. Особенно полезна проверка корреляции с людьми: она показывает, почему CLAP-подобная глобальная близость недостаточна для сложных текстовых подсказок.

Автоматическая метрикаЧеловеческий критерийSpearman rhop-value
Event SRCompleteness0.7430.0072
Attribute SRAttribute satisfaction0.8250.0003
Overall SRComposite semantics0.8790.0015
CLAPMSComposite semantics0.3120.0739

Как это читать: глобальное текст-аудио сходство почти не объясняет человеческую оценку выполнения подробных требований, а рубричная проверка намного ближе к тому, что слушатель считает семантически правильным.

Оригинальная статья на arXiv