Синтез речи Оценка качества Китайский
arXiv cs.CL

ASR-roundtrip: как распознавание скрывает ошибки китайского TTS

arXiv:2608.10606

Статья бьет по распространенной практике оценки синтеза речи через roundtrip: сгенерировали речь, распознали ее обратно и сравнили текст. Для китайских новостных текстов это может скрывать ошибки чтения имен, чисел, сокращений и полифонов, потому что система распознавания восстанавливает канонический текст по контексту. Главный вклад - аккуратный аудит случаев, где TTS звучит неверно, а автоматическая транскрипция делает вид, что все правильно.

Метод. Авторы берут пары исходного текста и синтезированной речи, затем вручную проверяют случаи, где обычный ASR-roundtrip не показывает ошибку. Они различают masked errors, exposed TTS errors и случаи без исходной ошибки. Чтобы отделить акустическую ошибку от языковой нормализации распознавания, фрагменты проверяются в полном контексте и в изолированных клипах, а также разными распознавателями.

Результаты. В пуле из 110 подозрительных случаев для MiMo подтверждено 46 masked errors и 9 exposed TTS errors; для CosyVoice - 51 masked и 27 exposed errors. В blind relabeling на 30 случаях точное согласие аннотаторов 23/30, kappa 0.634; в более грубой метке masked versus other - 27/30, kappa 0.800. Для 46 masked ошибок MiMo полноконтекстный ASR оставляет 34/46 surface-correct под обычным режимом и 27/46 под более строгим MiMo-V2-Omni.

Ограничения. Это targeted audit, а не оценка общей частоты ошибок в продакшене: пул специально собран вокруг подозрительных чтений. Для CosyVoice используется тот же Raw-only pool, поэтому сравнение систем ограничено. Изолированные клипы иногда дают no output или другие сбои, что усложняет чистую интерпретацию.

Фишка из статьи. Самая сильная демонстрация - разрез по контексту: одна и та же ошибка становится видимой, если вырезать короткий фрагмент из полной новости.

Условие для 46 MiMo maskedExposedMasked / no output
Полный исходный текст046 masked, 0 no output
Грубый 6-секундный клип1611 masked, 17 no output
Выровненный клип1812 masked, 13 no output

Как это читать: распознаватель в полном контексте не только слышит звук, но и подставляет ожидаемое чтение по языковой модели. Поэтому roundtrip-метрика может быть слишком доброй к TTS в местах, где человеку слышна ошибка.

Оригинальная статья на arXiv