Audio tokens Temporal grounding Interpretability
Audio LLM

Audio tokens в LALM: fine-tuning учит decoder читать уже имеющиеся события

mIoU 0.6817

Статья задает хороший диагностический вопрос: что именно меняется внутри audio-language model после fine-tuning на temporal grounding. Авторы показывают, что evidence о звуковом событии часто уже есть в audio tokens базовой модели, но decoder плохо умеет превратить его в временной ответ. Главный ход - разобрать путь от семантики события к readout и timestamp generation, а не просто показать рост mIoU.

Метод. На AudioGrounding-QA авторы сравнивают Qwen2.5-Omni-7B и Qwen2-Audio-7B-Instruct до и после LoRA fine-tuning. Диагностика включает query-conditioned token semantics, calibrated token readout, temporal-window probes и residual-delta erasure. Последний тест особенно строгий: на выбранном слое удаляется только residual update у audio tokens внутри предсказанного окна, после чего проверяется, портится ли timestamp.

Результаты. Fine-tuning сильно улучшает конечную temporal grounding метрику. У Qwen2.5-Omni mIoU растет с 0.3707 до 0.6817, F1 - с 0.4416 до 0.7626, R@0.7 - с 0.2349 до 0.5817. У Qwen2-Audio mIoU растет с 0.3653 до 0.6199, F1 - с 0.4667 до 0.7195. При этом probe-анализ показывает: ground-truth-window признаки были частично доступны и до fine-tuning, а главный рост идет в согласовании с собственными предсказанными окнами модели.

Ограничения. Это диагностическая работа на двух Qwen-моделях и одном преобразованном датасете AudioGrounding-QA, а не универсальная теория всех LALM. Readout использует SBERT и специальные probing-интервенции, поэтому численные значения зависят от выбранного протокола. Fine-tuning улучшает timestamp behavior, но не доказывает, что модель получила устойчивое причинное понимание событий во всех доменах.

Фишка из статьи. Самый сильный результат - residual-delta erasure: авторы проверяют не просто линейную декодируемость, а функциональную роль токенов в генерации timestamp.

Интервенция на Layer 16Доля испорченных примеровЧто удаляют
Predicted-window erasure39.0%Residual updates у audio tokens в предсказанном окне
Size-matched random erasure13.0%Столько же случайных audio tokens
Annotated-window erasure32.0%Audio tokens в ground-truth окне
All-audio erasure32.0%Все audio tokens

Как это читать: если стереть residual update именно там, где модель сама собирается ставить timestamp, ответ ломается в 39% случаев. Случайное стирание того же размера ломает только 13%, значит дело не просто в количестве удаленных токенов.

Оригинальная статья на arXiv