Перевод речи Streaming S2ST
Перевод речи

SimulS2ST-Omni: потоковый перевод речи с малым paired-бюджетом

~2k h S2ST

SimulS2ST-Omni рассматривает сложный режим: длинный потоковый перевод речи в речь, где система должна одновременно понимать вход, решать, когда говорить, и синтезировать целевой голосовой поток. Интерес статьи в том, что авторы не требуют десятки тысяч часов парной речи в речь: основной рецепт строится примерно на 2k часах paired-S2ST и большом количестве вспомогательных задач. Главный ход - явно обучать совместную траекторию текста и акустических кодов, а не выпускать речь отдельным нестабильным контроллером.

Метод. Модель разделена на Thinker и Talker: первый отвечает за языковое планирование и текстовые решения, второй - за плотное акустическое предсказание. Вместо обычной sentence-bounded разметки авторы задают commitment path для текста и семантических речевых кодов, причем задержка управляется множителем m. Дополнительное обучение на распознавании речи, speech-to-text translation, машинном переводе и синтезе снижает зависимость от дорогой парной S2ST-разметки.

Результаты. В offline CVSS-T вариант Thinker-Talker получает ASR-BLEU 31.12 для En->Zh и 25.18 для Zh->En, улучшая unified decoder на 4.00 и 1.77 BLEU соответственно. В потоковом RealSI на document-level En->Zh модель достигает ASR-BLEU 29.69 при m=4 и 30.04 при m=5, то есть выходит на уровень LiveInterpret 2.0 в этом срезе. Для Zh->En на sentence-level при m=5 получается 22.94 ASR-BLEU против 22.19 у LiveInterpret, но качество сильно зависит от выбранной задержки.

Ограничения. Работа большая и экспериментально плотная, но остается зависимой от собственных данных и протоколов RealSI/ACL60. ASR-BLEU удобен для автоматической оценки, однако не полностью описывает качество звучания, задержку восприятия и устойчивость к шуму. Человеческая оценка есть, но она ограничена 15 примерами на направление; для промышленного синхронного перевода нужен более широкий стресс-тест.

Фишка из статьи. Особенно важна абляция бюджета paired-S2ST: вспомогательные задачи не просто улучшают среднее качество, они удерживают систему от резкого падения, когда парной речи в речь остается только 10%.

En->Zh RealSI, Talkerm=1m=2m=3m=4
Full paired-S2ST17.3021.4923.0224.04
10% paired-S2ST15.5020.0021.4923.47
10% без auxiliary-задач9.4718.4621.1221.90

Как это читать: при низкой задержке m=1 вспомогательные данные особенно важны: без них BLEU падает с 15.50 до 9.47. При больших m разрыв меньше, но все равно показывает, что потоковый перевод выигрывает от многозадачного обучения, а не только от архитектуры.

Оригинальная статья на arXiv