звуковые языковые модели интерпретируемость скрытые представления
arXiv cs.SD

Can We Read the Mind of an Audio LLM? A Verbalizable, Multilingual Middle-Layer Workspace

arXiv:2608.24958

Работа исследует, где именно звуковая языковая модель превращает акустический сигнал в понятия, которые уже можно выразить словами. Вместо красивых карт внимания авторы считывают словарные предсказания из промежуточных слоев Qwen3-Omni и проверяют причинность подменой активаций; в итоге обнаруживается средняя полоса слоев, где ответ зависит от звука сильнее всего и еще не сведен к окончательной формулировке.

Метод. У 48-слойного блока Thinker логиты считывают на позициях звуковых токенов после каждого слоя. Для 140 вручную проверенных записей один и тот же вопрос с вариантами ответа подают вместе с настоящим звуком, тишиной или несоответствующей записью. Затем скрытые состояния из правильного прогона переносят в ошибочный и смотрят, восстановится ли ответ. Отдельно анализируют 948 записей для многоязычного считывания и 73 случая ошибочного описания звука.

Результаты. В средней «рабочей» полосе точность сбалансированного выбора из четырех ответов составляет 40,0% с настоящим звуком против 21,8% с тишиной и 32,2% с неверным звуком; различия с тишиной и подменой значимы, p=4,7·10-5 и p=0,015. Сигнал появляется примерно после 12% глубины. Подмена активаций восстанавливает правильный ответ в 10 из 10 случаев для сенсорной полосы и в 9 из 10 для средней, но ни разу для выходной. В 73 звуковых галлюцинациях неверное понятие впервые читается в медиане уже на 12% глубины, причем 84,9% ошибок возникают до выходной части.

Ограничения. Считывание через выходной словарь — косвенный измеритель: ранние состояния могут содержать информацию в форме, которую он не видит. Основные причинные опыты малы и выполнены прежде всего на одной модели, хотя общая слоевая картина повторяется на Qwen2.5-Omni. Результат локализует вычисление лишь грубо и ничего не доказывает о сознании или полноценном внутреннем языке модели.

Фишка из статьи. Высокая читаемость слоя сама по себе не означает, что он причинно определяет ответ. Совмещение считывания с подменой активаций показывает: выходная полоса лучше произносит уже выбранное понятие, но перенос ее состояния не исправляет ошибку.

Полоса слоевТочность: настоящий звукТочность: тишинаВосстановление подменой
Сенсорная41,0%38,0%10 из 10
Средняя рабочая40,0%21,8%9 из 10
Выходная48,9%34,7%0 из 10

Как это читать: средняя полоса не дает максимальной абсолютной точности, зато лучше всего отделяет акустическое свидетельство от текстовой догадки и остается причинно действенной. Именно это делает ее более интересной, чем последний слой.

Оригинальная статья на arXiv