понимание речи замороженные модели временные метки
arXiv eess.AS

Training-Free Speech-Centric Omni Understanding with Frozen VLMs

arXiv:2609.04242

Training-Free Omni добавляет речевое понимание к замороженной зрительно-языковой модели без многомодального обучения: Whisper превращает звук в отфильтрованную расшифровку с временными метками, после чего она подаётся через уже знакомый модели текстовый вход. Такой простой маршрут хорошо работает, когда смысл звука находится в словах, и столь же наглядно ломается на музыке и неречевых событиях.

Метод. Сегменты Whisper сохраняются при уверенности не ниже 0,65; если подходящих сегментов нет, звуковой контекст не добавляется. Расшифровка, изображение или видео и вопрос объединяются без изменения параметров основы. Авторы проводят пять согласованных сравнений на четырёх семействах моделей, 56 наборах и 21 языке CoVoST2.

Результаты. Средняя точность на девяти звуковых задачах растёт во всех пяти сравнениях; особенно заметен переход VILA с 50,3 до 63,8. На CoVoST2 средний прирост составляет от 6,8 до 18,4 пункта в зависимости от основы. В звуко-зрительных задачах Qwen2.5-3B и 7B прибавляют 3,0 и 2,2 пункта, а MiniCPM4.5 и Qwen3, напротив, теряют 2,2 и 0,8. Последовательный запуск Whisper увеличивает задержку примерно с 0,7–2,4 до 1,3–3,1 секунды.

Ограничения. Расшифровка удаляет тембр, интонацию, музыку и события среды и наследует ошибки Whisper. На MMAR-Bench все варианты теряют от 1,5 до 9,5 пункта, а текстовые описания от дополнительных звуковых моделей не устраняют проблему устойчиво. Выигрыш по времени обучения превращается в дополнительную задержку при каждом новом звуке.

Фишка из статьи. Усреднение скрывает очень чистый обмен: один и тот же маршрут улучшает речевые задачи во всех семействах и одновременно ухудшает MMAR-Bench во всех семействах.

ОсноваСреднее, родная многомодальнаяСреднее, через WhisperMMAR, роднаяMMAR, через Whisper
Qwen2.5 3B59,561,055,449,7
Qwen2.5 7B60,561,955,849,4
MiniCPM4.560,664,659,057,5
VILA50,363,861,454,6
Qwen3 30B71,773,173,463,9

Как это читать: высокий средний прирост VILA в 13,5 пункта не означает полноценного звукового понимания — на MMAR та же система теряет 6,8. Временные метки действительно помогают синхронизации: их удаление снижает AVUT-Gemini на 2,3 пункта и Daily-Omni на 1,4, но неречевую информацию они вернуть не могут.

Оригинальная статья на arXiv