перевод речи синтез речи управление длительностью
arXiv cs.SD

DuraS2ST: перевод речи в речь с согласованием длительности

arXiv:2609.33742

DuraS2ST заставляет перевод речи укладываться в длительность исходной реплики, не обрезая синтез и не ускоряя готовую запись. Модель сначала планирует формулировку и фонетическую длину перевода, затем получает награду одновременно за смысл и временное совпадение.

Метод. Обучение начинается с DuraSet-440K, где собраны пары с рассуждением о длине, затем применяется GRPO с наградами за перевод и длительность. Вариант Think явно строит план, Think-RL дополнительно оптимизирует его по измеряемому рассогласованию.

Результаты. Для английского в китайский базовая система получает средний BLEU 27,25 и среднюю абсолютную ошибку длительности 2,04 с. Think-RL повышает BLEU до 30,95, долю реплик с близкой длиной до 0,997 и снижает ошибку до 0,23 с. В оценке шести слушателей средний MOS достигает 4,30.

Ограничения. Проверены только направления китайский-английский. Часть данных создана и отфильтрована моделями, субъективная оценка невелика, а задержка явного этапа планирования не разобрана как свойство потоковой системы.

Фишка из статьи. Простая инструкция уже почти решает длительность, но явное рассуждение улучшает и перевод, и синхронность. Обучение с подкреплением добавляет BLEU, однако по абсолютной ошибке немного уступает варианту Think без GRPO.

EN→ZHBLEU ↑Доля близкой длительности ↑Абсолютная ошибка ↓Относительная ошибка ↓
Базовая27,250,4872,04 с0,629
Instruction29,110,9810,63 с0,090
Think29,930,9930,18 с0,039
Think-RL30,950,9970,23 с0,038

Как это читать: GRPO даёт лучший общий баланс и BLEU, но не минимальную абсолютную ошибку. Это предупреждает против сведения многокритериальной задачи к одной итоговой строке.

Оригинальная статья на arXiv