VoxSumm: длинная устная новость, перевод и краткое изложение
VoxSumm закрывает редкую комбинацию задач: нужно слушать длинную новость, кратко изложить ее и при необходимости перевести результат. Это ближе к реальным сценариям, чем короткие команды или отдельное распознавание речи. Авторы строят многоязычный корпус на базе BBC/CrossSum и показывают, что даже сильные мультимодальные модели теряют качество, когда вход становится аудио, а не текстом.
Метод. Корпус содержит 10 045 пар статья-сводка на 24 языках и около 703 часов синтезированной речи, в среднем примерно 29 часов на язык. Речь генерируется фрагментами до 1200 символов с частотой 24 кГц; языки с плохим качеством синтеза отфильтровываются. Задача Joint Summarization and Translation проверяется как end-to-end режим и через каскады: сначала перевод, затем суммаризация, или наоборот.
Результаты. Gemini-3.1-Pro показывает лучший средний BERTScore около 0.703, Qwen3-Omni - 0.657, Gemma - 0.617. Few-shot режим для Gemini поднимает BERTScore до 0.727 против 0.691-0.692 для zero-shot и CoT. По xCOMET в направлении English-to-XX Gemini также лидирует со средним 0.279 против 0.211 у Gemma и 0.220 у Qwen. При сравнении аудио и текста у Qwen3 few-shot текстовый вход дает средний BERTScore 0.682, аудио - 0.666.
Ограничения. Речь в корпусе синтезированная, поэтому он не покрывает реальные дикторские паузы, шумы, оговорки и монтаж новостей. Домен в основном новостной, с BBC/CrossSum источником. Человеческая оценка проведена не для всех 24 языков, а поддержка низкоресурсных языков у современных моделей неравномерна.
Фишка из статьи. Самый полезный результат - модальная абляция: текстовая версия той же задачи стабильно проще, чем аудио.
| Условие Qwen3 few-shot | Средний BERTScore | Что показывает |
|---|---|---|
| Аудио-вход | 0.666 | модель должна извлекать смысл из речи |
| Текстовый вход | 0.682 | та же задача без акустического фронтенда |
| Разрыв | +0.017 в пользу текста | аудиомодальность остается источником потерь |
Как это читать: VoxSumm полезен именно тем, что не дает спрятать проблему за отдельный ASR. Если текстовое изложение лучше аудио-изложения на том же содержании, слабое место может быть в акустическом кодировании и длинном аудиоконтексте, а не только в генерации summary.