SAIL: пространственное понимание звука языковой моделью с разделённым акустико-пространственным кодированием
SAIL учит языковую модель отвечать не только на вопрос «что звучит», но и «где находится источник». Отдельный DSAT-кодировщик разводит источники по слотам, а двухпоточный Q-Former передаёт в языковую часть акустическое содержание и межканальные фазовые признаки.
Метод. Обучение использует около 872 тысяч вопросов и ответов из 90 смоделированных помещений. Источники представлены раздельно, чтобы одна общая акустическая сводка не смешивала класс события, азимут, высоту и расстояние.
Результаты. Для двух источников DSAT повышает mAP обнаружения с 15,52 до 31,66 и уменьшает угловую ошибку с 54,45° до 29,59°. В вопросах о направлении SAIL достигает точности 46,65% против 35,12% у BAT; средний результат двоичных пространственных рассуждений равен 81,44% против 75,12%.
Ограничения. Все сцены смоделированы, одновременно рассматриваются не более двух источников. Оценка расстояния остаётся слабой, а перенос на произвольные микрофоны и настоящие помещения не показан.
Фишка из статьи. Более новая языковая основа не улучшила пространственное рассуждение: Llama2-7B получила 81,44%, Llama3.1-8B 78,36%. Ещё жёстче отрицательный результат по расстоянию: DER практически совпала с базовой системой.
| Проверка | BAT | SAIL | Вывод |
|---|---|---|---|
| Направление, точность ↑ | 35,12% | 46,65% | Раздельное кодирование помогает |
| Направление, DER ↓ | 52,85° | 47,25° | Умеренный выигрыш |
| Расстояние между источниками, DER ↓ | 50,53 | 50,54 | Выигрыша нет |
| Двоичные рассуждения, среднее ↑ | 75,12% | 81,44% | Улучшение на 6,32 пункта |
Как это читать: модель действительно лучше извлекает направление, но не геометрию целиком. Расстояние остаётся отдельной нерешённой задачей, которую нельзя скрыть средним результатом по пространственным вопросам.