DuraS2ST: перевод речи в речь с согласованием длительности
DuraS2ST заставляет перевод речи укладываться в длительность исходной реплики, не обрезая синтез и не ускоряя готовую запись. Модель сначала планирует формулировку и фонетическую длину перевода, затем получает награду одновременно за смысл и временное совпадение.
Метод. Обучение начинается с DuraSet-440K, где собраны пары с рассуждением о длине, затем применяется GRPO с наградами за перевод и длительность. Вариант Think явно строит план, Think-RL дополнительно оптимизирует его по измеряемому рассогласованию.
Результаты. Для английского в китайский базовая система получает средний BLEU 27,25 и среднюю абсолютную ошибку длительности 2,04 с. Think-RL повышает BLEU до 30,95, долю реплик с близкой длиной до 0,997 и снижает ошибку до 0,23 с. В оценке шести слушателей средний MOS достигает 4,30.
Ограничения. Проверены только направления китайский-английский. Часть данных создана и отфильтрована моделями, субъективная оценка невелика, а задержка явного этапа планирования не разобрана как свойство потоковой системы.
Фишка из статьи. Простая инструкция уже почти решает длительность, но явное рассуждение улучшает и перевод, и синхронность. Обучение с подкреплением добавляет BLEU, однако по абсолютной ошибке немного уступает варианту Think без GRPO.
| EN→ZH | BLEU ↑ | Доля близкой длительности ↑ | Абсолютная ошибка ↓ | Относительная ошибка ↓ |
|---|---|---|---|---|
| Базовая | 27,25 | 0,487 | 2,04 с | 0,629 |
| Instruction | 29,11 | 0,981 | 0,63 с | 0,090 |
| Think | 29,93 | 0,993 | 0,18 с | 0,039 |
| Think-RL | 30,95 | 0,997 | 0,23 с | 0,038 |
Как это читать: GRPO даёт лучший общий баланс и BLEU, но не минимальную абсолютную ошибку. Это предупреждает против сведения многокритериальной задачи к одной итоговой строке.