Audio tokens в LALM: fine-tuning учит decoder читать уже имеющиеся события
Статья задает хороший диагностический вопрос: что именно меняется внутри audio-language model после fine-tuning на temporal grounding. Авторы показывают, что evidence о звуковом событии часто уже есть в audio tokens базовой модели, но decoder плохо умеет превратить его в временной ответ. Главный ход - разобрать путь от семантики события к readout и timestamp generation, а не просто показать рост mIoU.
Метод. На AudioGrounding-QA авторы сравнивают Qwen2.5-Omni-7B и Qwen2-Audio-7B-Instruct до и после LoRA fine-tuning. Диагностика включает query-conditioned token semantics, calibrated token readout, temporal-window probes и residual-delta erasure. Последний тест особенно строгий: на выбранном слое удаляется только residual update у audio tokens внутри предсказанного окна, после чего проверяется, портится ли timestamp.
Результаты. Fine-tuning сильно улучшает конечную temporal grounding метрику. У Qwen2.5-Omni mIoU растет с 0.3707 до 0.6817, F1 - с 0.4416 до 0.7626, R@0.7 - с 0.2349 до 0.5817. У Qwen2-Audio mIoU растет с 0.3653 до 0.6199, F1 - с 0.4667 до 0.7195. При этом probe-анализ показывает: ground-truth-window признаки были частично доступны и до fine-tuning, а главный рост идет в согласовании с собственными предсказанными окнами модели.
Ограничения. Это диагностическая работа на двух Qwen-моделях и одном преобразованном датасете AudioGrounding-QA, а не универсальная теория всех LALM. Readout использует SBERT и специальные probing-интервенции, поэтому численные значения зависят от выбранного протокола. Fine-tuning улучшает timestamp behavior, но не доказывает, что модель получила устойчивое причинное понимание событий во всех доменах.
Фишка из статьи. Самый сильный результат - residual-delta erasure: авторы проверяют не просто линейную декодируемость, а функциональную роль токенов в генерации timestamp.
| Интервенция на Layer 16 | Доля испорченных примеров | Что удаляют |
|---|---|---|
| Predicted-window erasure | 39.0% | Residual updates у audio tokens в предсказанном окне |
| Size-matched random erasure | 13.0% | Столько же случайных audio tokens |
| Annotated-window erasure | 32.0% | Audio tokens в ground-truth окне |
| All-audio erasure | 32.0% | Все audio tokens |
Как это читать: если стереть residual update именно там, где модель сама собирается ставить timestamp, ответ ломается в 39% случаев. Случайное стирание того же размера ломает только 13%, значит дело не просто в количестве удаленных токенов.