аудиоязыковые модели слуховые иллюзии оценка моделей
arXiv cs.SD

Auditory Illusion Benchmark for Large Audio Language Models

arXiv:2609.02277

Этот набор проверяет, слышат ли большие аудиоязыковые модели иллюзию так же, как человек, или буквально описывают физический сигнал. Важное отличие от обычной оценки понимания звука — отдельные контрольные примеры и две оси результата: согласие с человеческим восприятием и согласие с измеримой физикой.

Метод. В наборе 14 829 примеров: 10 385 вариантов десяти слуховых иллюзий и 4444 контроля без иллюзии. Он охватывает музыку, бытовые звуки и речь, включая превращение речи в песню и фонемное восстановление. Эталон получен голосованием двадцати слушателей с абсолютным слухом. Показатель ISI вычисляется как разность согласия с человеком и согласия с физической разметкой.

Результаты. Ни одна модель не воспроизводит человеческий профиль полностью. Лучший средний ISI среди содержательных моделей у Audio Flamingo 3 равен 0,455 при человеческом значении 1,0. Простейшая стратегия «всегда отвечать, что иллюзия есть» получает 0,799, но её согласие с физикой падает до 0,110 на соответствующем разделе, то есть высокий итог легко подделать смещением ответа. Формулировка запроса меняет ISI отдельных моделей вплоть до 0,6.

Ограничения. Эталон строится по двадцати необычно подготовленным слушателям, а пространственные и бинауральные иллюзии исключены. Свободные ответы некоторых моделей плохо разбираются автоматически; доля таких сбоев местами превышает 20%. Сильная чувствительность к запросу означает, что одно число нельзя переносить на произвольный диалоговый интерфейс.

Фишка из статьи. Контрольные примеры раскрывают модель, которая получает высокий балл не за восприятие, а за привычку подтверждать иллюзию.

СистемаСредний ISIТочность на контролеISI в разделе физики
Человек1,0001,0001,000
Всегда «иллюзия»0,7990,5600,110
Audio Flamingo 30,4550,5740,271

Как это читать: наивная постоянная стратегия обгоняет обученные модели по среднему ISI, но проваливает проверку физического сигнала. Поэтому сам ISI полезен только вместе с контролем и разложением по типам иллюзий.

Оригинальная статья на arXiv