SimulS2ST-Omni: потоковый перевод речи с малым paired-бюджетом
SimulS2ST-Omni рассматривает сложный режим: длинный потоковый перевод речи в речь, где система должна одновременно понимать вход, решать, когда говорить, и синтезировать целевой голосовой поток. Интерес статьи в том, что авторы не требуют десятки тысяч часов парной речи в речь: основной рецепт строится примерно на 2k часах paired-S2ST и большом количестве вспомогательных задач. Главный ход - явно обучать совместную траекторию текста и акустических кодов, а не выпускать речь отдельным нестабильным контроллером.
Метод. Модель разделена на Thinker и Talker: первый отвечает за языковое планирование и текстовые решения, второй - за плотное акустическое предсказание. Вместо обычной sentence-bounded разметки авторы задают commitment path для текста и семантических речевых кодов, причем задержка управляется множителем m. Дополнительное обучение на распознавании речи, speech-to-text translation, машинном переводе и синтезе снижает зависимость от дорогой парной S2ST-разметки.
Результаты. В offline CVSS-T вариант Thinker-Talker получает ASR-BLEU 31.12 для En->Zh и 25.18 для Zh->En, улучшая unified decoder на 4.00 и 1.77 BLEU соответственно. В потоковом RealSI на document-level En->Zh модель достигает ASR-BLEU 29.69 при m=4 и 30.04 при m=5, то есть выходит на уровень LiveInterpret 2.0 в этом срезе. Для Zh->En на sentence-level при m=5 получается 22.94 ASR-BLEU против 22.19 у LiveInterpret, но качество сильно зависит от выбранной задержки.
Ограничения. Работа большая и экспериментально плотная, но остается зависимой от собственных данных и протоколов RealSI/ACL60. ASR-BLEU удобен для автоматической оценки, однако не полностью описывает качество звучания, задержку восприятия и устойчивость к шуму. Человеческая оценка есть, но она ограничена 15 примерами на направление; для промышленного синхронного перевода нужен более широкий стресс-тест.
Фишка из статьи. Особенно важна абляция бюджета paired-S2ST: вспомогательные задачи не просто улучшают среднее качество, они удерживают систему от резкого падения, когда парной речи в речь остается только 10%.
| En->Zh RealSI, Talker | m=1 | m=2 | m=3 | m=4 |
|---|---|---|---|---|
| Full paired-S2ST | 17.30 | 21.49 | 23.02 | 24.04 |
| 10% paired-S2ST | 15.50 | 20.00 | 21.49 | 23.47 |
| 10% без auxiliary-задач | 9.47 | 18.46 | 21.12 | 21.90 |
Как это читать: при низкой задержке m=1 вспомогательные данные особенно важны: без них BLEU падает с 15.50 до 9.47. При больших m разрыв меньше, но все равно показывает, что потоковый перевод выигрывает от многозадачного обучения, а не только от архитектуры.