Training-Free Speech-Centric Omni Understanding with Frozen VLMs
Training-Free Omni добавляет речевое понимание к замороженной зрительно-языковой модели без многомодального обучения: Whisper превращает звук в отфильтрованную расшифровку с временными метками, после чего она подаётся через уже знакомый модели текстовый вход. Такой простой маршрут хорошо работает, когда смысл звука находится в словах, и столь же наглядно ломается на музыке и неречевых событиях.
Метод. Сегменты Whisper сохраняются при уверенности не ниже 0,65; если подходящих сегментов нет, звуковой контекст не добавляется. Расшифровка, изображение или видео и вопрос объединяются без изменения параметров основы. Авторы проводят пять согласованных сравнений на четырёх семействах моделей, 56 наборах и 21 языке CoVoST2.
Результаты. Средняя точность на девяти звуковых задачах растёт во всех пяти сравнениях; особенно заметен переход VILA с 50,3 до 63,8. На CoVoST2 средний прирост составляет от 6,8 до 18,4 пункта в зависимости от основы. В звуко-зрительных задачах Qwen2.5-3B и 7B прибавляют 3,0 и 2,2 пункта, а MiniCPM4.5 и Qwen3, напротив, теряют 2,2 и 0,8. Последовательный запуск Whisper увеличивает задержку примерно с 0,7–2,4 до 1,3–3,1 секунды.
Ограничения. Расшифровка удаляет тембр, интонацию, музыку и события среды и наследует ошибки Whisper. На MMAR-Bench все варианты теряют от 1,5 до 9,5 пункта, а текстовые описания от дополнительных звуковых моделей не устраняют проблему устойчиво. Выигрыш по времени обучения превращается в дополнительную задержку при каждом новом звуке.
Фишка из статьи. Усреднение скрывает очень чистый обмен: один и тот же маршрут улучшает речевые задачи во всех семействах и одновременно ухудшает MMAR-Bench во всех семействах.
| Основа | Среднее, родная многомодальная | Среднее, через Whisper | MMAR, родная | MMAR, через Whisper |
|---|---|---|---|---|
| Qwen2.5 3B | 59,5 | 61,0 | 55,4 | 49,7 |
| Qwen2.5 7B | 60,5 | 61,9 | 55,8 | 49,4 |
| MiniCPM4.5 | 60,6 | 64,6 | 59,0 | 57,5 |
| VILA | 50,3 | 63,8 | 61,4 | 54,6 |
| Qwen3 30B | 71,7 | 73,1 | 73,4 | 63,9 |
Как это читать: высокий средний прирост VILA в 13,5 пункта не означает полноценного звукового понимания — на MMAR та же система теряет 6,8. Временные метки действительно помогают синхронизации: их удаление снижает AVUT-Gemini на 2,3 пункта и Daily-Omni на 1,4, но неречевую информацию они вернуть не могут.