Audio-language Оценка качества Negation
Оценка аудиомоделей

NegEval-Audio: audio-language модели плохо понимают отрицание

0.2-7.1% negation

Статья показывает скрытый дефект audio-language embeddings: модели хорошо находят присутствующие звуки, но почти не умеют использовать отрицание как ограничение. Запросы вида «speech without background music» или «rain without thunder» для таких систем не экзотика, а нормальный пользовательский сценарий. Авторы строят NegEval-Audio и показывают, что CLAP, M2D-CLAP и WAVE-7B часто сближают affirmative и negated captions почти в одну область embedding space.

Метод. NegEval-Audio преобразует AudioCaps и Clotho без сбора нового аудио. Из caption извлекаются positive sound concepts, затем LLM предлагает plausible absent concepts, а audio-aware LLM проверяет, что этих звуков нет в клипе. На ручной проверке 200 clips и 460 negative concepts согласие человека с verifier составило 96.7%. Дальше строятся две задачи: Retrieval-Neg, где запрос содержит присутствующие и отсутствующие звуки, и MCQ-Neg, где четыре варианта отличаются тем, какой звук утверждается или отрицается.

Результаты. На AudioCaps средний R@1/R@5/R@10 падает с 34.1/69.5/82.8 в стандартном retrieval до 26.1/59.8/75.1 в Retrieval-Neg. На Clotho падение меньше, но устойчивое: с 16.1/38.4/51.4 до 14.4/35.8/47.8. MCQ-Neg дает более резкую диагностику: affirmation-вопросы остаются сильно выше random baseline, но negation accuracy падает до 0.2-1.1% на AudioCaps и 1.9-7.1% на Clotho при 25% случайном уровне. Training-free steering слегка помогает retrieval и заметно улучшает WAVE-7B MCQ average с 43.5% до 54.5% на AudioCaps, но не решает геометрию retrieval space.

Ограничения. В Retrieval-Neg добавляется только один negated concept, поэтому множественные, вложенные и более сложные отрицания не проверяются. Датасеты в основном про environmental sounds, а не про spoken content, музыкальные атрибуты или сложные речевые события. Steering предполагает, что negated span уже известен; для произвольных пользовательских запросов понадобится отдельный parser. Проверка absent concepts через audio-aware LLM потенциально спорна, хотя авторы снижают риск ручной валидацией.

Фишка из статьи. Самый сильный сигнал - не падение retrieval, а почти нулевая точность на negation-вариантах MCQ. Модель видит упомянутый sound concept и ведет себя так, будто слово «no» слабее самого существительного.

МодельAudioCaps AffirmationAudioCaps NegationClotho AffirmationClotho Negation
LAION-CLAP 630k-audioset-best81.1%0.6%59.8%1.9%
LAION-CLAP music-audioset85.4%0.6%59.6%7.1%
M2D-CLAP-202569.4%0.2%42.7%3.9%
WAVE-7B78.3%0.9%75.0%5.3%

Как это читать: это четырехвариантный multiple choice, где random baseline равен 25%. Значения ниже 1% означают систематический переворот логики: negated concept продолжает притягивать модель, вместо того чтобы исключать аудио с этим звуком.

Оригинальная статья на arXiv