Index-Translate: семейство многоязычных моделей для перевода текста и речи, управляемого дубляжа и длинных документов
Index-Translate объединяет в одном семействе перевод текста, речи и длинных документов, а также дубляж с заданным числом слогов. Для речевых технологий наиболее интересны Index-Echo, который переводит звук с временными метками и может сразу синтезировать результат, и Index-Homura, который подстраивает перевод под длительность реплики.
Метод. Базовые модели имеют размеры 2B, 9B и 35B-A3B и поддерживают около 150 языков. Index-Echo совместно решает распознавание, перевод и разметку начала фраз; в варианте «речь-в-речь» акустический декодер сравнивается с конвейером Index-Echo плюс CosyVoice3. Index-Homura обучается по подкреплению соблюдать заданное число слогов.
Результаты. На внутреннем видеонаборе Index-Echo-9B получает оценку перевода 0,857, медианную ошибку распознавания 0,102 и среднюю ошибку начала фразы 0,488 с. Версия 2B имеет ещё меньшие 0,088 и 0,395 с, но оценку перевода 0,825. Прямой речевой перевод снижает среднюю ошибку содержания в 8 из 12 сочетаний размера и направления по сравнению с конвейером.
Ограничения. Ключевые речевые испытания внутренние: 140 окон для перевода в текст и шесть направлений для дубляжа. Качество перевода оценивает Gemini, а открытые ориентиры не всегда получают сопоставимые ограничения по длине и временным меткам. Широкое семейство затрудняет отделение вклада данных, архитектуры и обучения по подкреплению.
Фишка из статьи. Управление длиной показывает явный обмен качества на синхронность. После обучения по подкреплению Index-Homura-9B попадает в коридор ±10% в 81,92% случаев вместо 45,75% у SFT, но автоматическая оценка перевода снижается с 0,8581 до 0,7863.
| Модель | Качество перевода ↑ | Среднее отклонение длины ↓ | В пределах ±10% ↑ |
|---|---|---|---|
| Index-Homura-9B, SFT | 0,8581 | 0,1752 | 45,75% |
| Index-Homura-9B, RL | 0,7863 | 0,0693 | 81,92% |
| GPT-5.6-Sol | 0,8715 | 0,3223 | 47,64% |
| DeepSeek-V4-Flash | 0,8742 | 0,3368 | 16,36% |
Как это читать: общая модель перевода может получить более высокий балл за смысл, но плохо соблюдать монтажную длительность. Homura сознательно отдаёт часть автоматической оценки за существенно более предсказуемое число слогов.