пространственный звук звуковые языковые модели локализация источников
arXiv cs.SD

SAIL: пространственное понимание звука языковой моделью с разделённым акустико-пространственным кодированием

arXiv:2609.34347

SAIL учит языковую модель отвечать не только на вопрос «что звучит», но и «где находится источник». Отдельный DSAT-кодировщик разводит источники по слотам, а двухпоточный Q-Former передаёт в языковую часть акустическое содержание и межканальные фазовые признаки.

Метод. Обучение использует около 872 тысяч вопросов и ответов из 90 смоделированных помещений. Источники представлены раздельно, чтобы одна общая акустическая сводка не смешивала класс события, азимут, высоту и расстояние.

Результаты. Для двух источников DSAT повышает mAP обнаружения с 15,52 до 31,66 и уменьшает угловую ошибку с 54,45° до 29,59°. В вопросах о направлении SAIL достигает точности 46,65% против 35,12% у BAT; средний результат двоичных пространственных рассуждений равен 81,44% против 75,12%.

Ограничения. Все сцены смоделированы, одновременно рассматриваются не более двух источников. Оценка расстояния остаётся слабой, а перенос на произвольные микрофоны и настоящие помещения не показан.

Фишка из статьи. Более новая языковая основа не улучшила пространственное рассуждение: Llama2-7B получила 81,44%, Llama3.1-8B 78,36%. Ещё жёстче отрицательный результат по расстоянию: DER практически совпала с базовой системой.

ПроверкаBATSAILВывод
Направление, точность ↑35,12%46,65%Раздельное кодирование помогает
Направление, DER ↓52,85°47,25°Умеренный выигрыш
Расстояние между источниками, DER ↓50,5350,54Выигрыша нет
Двоичные рассуждения, среднее ↑75,12%81,44%Улучшение на 6,32 пункта

Как это читать: модель действительно лучше извлекает направление, но не геометрию целиком. Расстояние остаётся отдельной нерешённой задачей, которую нельзя скрыть средним результатом по пространственным вопросам.

Оригинальная статья на arXiv