NegEval-Audio: audio-language модели плохо понимают отрицание
Статья показывает скрытый дефект audio-language embeddings: модели хорошо находят присутствующие звуки, но почти не умеют использовать отрицание как ограничение. Запросы вида «speech without background music» или «rain without thunder» для таких систем не экзотика, а нормальный пользовательский сценарий. Авторы строят NegEval-Audio и показывают, что CLAP, M2D-CLAP и WAVE-7B часто сближают affirmative и negated captions почти в одну область embedding space.
Метод. NegEval-Audio преобразует AudioCaps и Clotho без сбора нового аудио. Из caption извлекаются positive sound concepts, затем LLM предлагает plausible absent concepts, а audio-aware LLM проверяет, что этих звуков нет в клипе. На ручной проверке 200 clips и 460 negative concepts согласие человека с verifier составило 96.7%. Дальше строятся две задачи: Retrieval-Neg, где запрос содержит присутствующие и отсутствующие звуки, и MCQ-Neg, где четыре варианта отличаются тем, какой звук утверждается или отрицается.
Результаты. На AudioCaps средний R@1/R@5/R@10 падает с 34.1/69.5/82.8 в стандартном retrieval до 26.1/59.8/75.1 в Retrieval-Neg. На Clotho падение меньше, но устойчивое: с 16.1/38.4/51.4 до 14.4/35.8/47.8. MCQ-Neg дает более резкую диагностику: affirmation-вопросы остаются сильно выше random baseline, но negation accuracy падает до 0.2-1.1% на AudioCaps и 1.9-7.1% на Clotho при 25% случайном уровне. Training-free steering слегка помогает retrieval и заметно улучшает WAVE-7B MCQ average с 43.5% до 54.5% на AudioCaps, но не решает геометрию retrieval space.
Ограничения. В Retrieval-Neg добавляется только один negated concept, поэтому множественные, вложенные и более сложные отрицания не проверяются. Датасеты в основном про environmental sounds, а не про spoken content, музыкальные атрибуты или сложные речевые события. Steering предполагает, что negated span уже известен; для произвольных пользовательских запросов понадобится отдельный parser. Проверка absent concepts через audio-aware LLM потенциально спорна, хотя авторы снижают риск ручной валидацией.
Фишка из статьи. Самый сильный сигнал - не падение retrieval, а почти нулевая точность на negation-вариантах MCQ. Модель видит упомянутый sound concept и ведет себя так, будто слово «no» слабее самого существительного.
| Модель | AudioCaps Affirmation | AudioCaps Negation | Clotho Affirmation | Clotho Negation |
|---|---|---|---|---|
| LAION-CLAP 630k-audioset-best | 81.1% | 0.6% | 59.8% | 1.9% |
| LAION-CLAP music-audioset | 85.4% | 0.6% | 59.6% | 7.1% |
| M2D-CLAP-2025 | 69.4% | 0.2% | 42.7% | 3.9% |
| WAVE-7B | 78.3% | 0.9% | 75.0% | 5.3% |
Как это читать: это четырехвариантный multiple choice, где random baseline равен 25%. Значения ниже 1% означают систематический переворот логики: negated concept продолжает притягивать модель, вместо того чтобы исключать аудио с этим звуком.