перевод речи дубляж многоязычные модели
arXiv cs.CL

Index-Translate: семейство многоязычных моделей для перевода текста и речи, управляемого дубляжа и длинных документов

arXiv:2609.40181

Index-Translate объединяет в одном семействе перевод текста, речи и длинных документов, а также дубляж с заданным числом слогов. Для речевых технологий наиболее интересны Index-Echo, который переводит звук с временными метками и может сразу синтезировать результат, и Index-Homura, который подстраивает перевод под длительность реплики.

Метод. Базовые модели имеют размеры 2B, 9B и 35B-A3B и поддерживают около 150 языков. Index-Echo совместно решает распознавание, перевод и разметку начала фраз; в варианте «речь-в-речь» акустический декодер сравнивается с конвейером Index-Echo плюс CosyVoice3. Index-Homura обучается по подкреплению соблюдать заданное число слогов.

Результаты. На внутреннем видеонаборе Index-Echo-9B получает оценку перевода 0,857, медианную ошибку распознавания 0,102 и среднюю ошибку начала фразы 0,488 с. Версия 2B имеет ещё меньшие 0,088 и 0,395 с, но оценку перевода 0,825. Прямой речевой перевод снижает среднюю ошибку содержания в 8 из 12 сочетаний размера и направления по сравнению с конвейером.

Ограничения. Ключевые речевые испытания внутренние: 140 окон для перевода в текст и шесть направлений для дубляжа. Качество перевода оценивает Gemini, а открытые ориентиры не всегда получают сопоставимые ограничения по длине и временным меткам. Широкое семейство затрудняет отделение вклада данных, архитектуры и обучения по подкреплению.

Фишка из статьи. Управление длиной показывает явный обмен качества на синхронность. После обучения по подкреплению Index-Homura-9B попадает в коридор ±10% в 81,92% случаев вместо 45,75% у SFT, но автоматическая оценка перевода снижается с 0,8581 до 0,7863.

МодельКачество перевода ↑Среднее отклонение длины ↓В пределах ±10% ↑
Index-Homura-9B, SFT0,85810,175245,75%
Index-Homura-9B, RL0,78630,069381,92%
GPT-5.6-Sol0,87150,322347,64%
DeepSeek-V4-Flash0,87420,336816,36%

Как это читать: общая модель перевода может получить более высокий балл за смысл, но плохо соблюдать монтажную длительность. Homura сознательно отдаёт часть автоматической оценки за существенно более предсказуемое число слогов.

Оригинальная статья на arXiv