Резюмирование речи Перевод речи Бенчмарк
arXiv cs.CL

VoxSumm: длинная устная новость, перевод и краткое изложение

arXiv:2608.10359

VoxSumm закрывает редкую комбинацию задач: нужно слушать длинную новость, кратко изложить ее и при необходимости перевести результат. Это ближе к реальным сценариям, чем короткие команды или отдельное распознавание речи. Авторы строят многоязычный корпус на базе BBC/CrossSum и показывают, что даже сильные мультимодальные модели теряют качество, когда вход становится аудио, а не текстом.

Метод. Корпус содержит 10 045 пар статья-сводка на 24 языках и около 703 часов синтезированной речи, в среднем примерно 29 часов на язык. Речь генерируется фрагментами до 1200 символов с частотой 24 кГц; языки с плохим качеством синтеза отфильтровываются. Задача Joint Summarization and Translation проверяется как end-to-end режим и через каскады: сначала перевод, затем суммаризация, или наоборот.

Результаты. Gemini-3.1-Pro показывает лучший средний BERTScore около 0.703, Qwen3-Omni - 0.657, Gemma - 0.617. Few-shot режим для Gemini поднимает BERTScore до 0.727 против 0.691-0.692 для zero-shot и CoT. По xCOMET в направлении English-to-XX Gemini также лидирует со средним 0.279 против 0.211 у Gemma и 0.220 у Qwen. При сравнении аудио и текста у Qwen3 few-shot текстовый вход дает средний BERTScore 0.682, аудио - 0.666.

Ограничения. Речь в корпусе синтезированная, поэтому он не покрывает реальные дикторские паузы, шумы, оговорки и монтаж новостей. Домен в основном новостной, с BBC/CrossSum источником. Человеческая оценка проведена не для всех 24 языков, а поддержка низкоресурсных языков у современных моделей неравномерна.

Фишка из статьи. Самый полезный результат - модальная абляция: текстовая версия той же задачи стабильно проще, чем аудио.

Условие Qwen3 few-shotСредний BERTScoreЧто показывает
Аудио-вход0.666модель должна извлекать смысл из речи
Текстовый вход0.682та же задача без акустического фронтенда
Разрыв+0.017 в пользу текстааудиомодальность остается источником потерь

Как это читать: VoxSumm полезен именно тем, что не дает спрятать проблему за отдельный ASR. Если текстовое изложение лучше аудио-изложения на том же содержании, слабое место может быть в акустическом кодировании и длинном аудиоконтексте, а не только в генерации summary.

Оригинальная статья на arXiv