ASR-roundtrip: как распознавание скрывает ошибки китайского TTS
Статья бьет по распространенной практике оценки синтеза речи через roundtrip: сгенерировали речь, распознали ее обратно и сравнили текст. Для китайских новостных текстов это может скрывать ошибки чтения имен, чисел, сокращений и полифонов, потому что система распознавания восстанавливает канонический текст по контексту. Главный вклад - аккуратный аудит случаев, где TTS звучит неверно, а автоматическая транскрипция делает вид, что все правильно.
Метод. Авторы берут пары исходного текста и синтезированной речи, затем вручную проверяют случаи, где обычный ASR-roundtrip не показывает ошибку. Они различают masked errors, exposed TTS errors и случаи без исходной ошибки. Чтобы отделить акустическую ошибку от языковой нормализации распознавания, фрагменты проверяются в полном контексте и в изолированных клипах, а также разными распознавателями.
Результаты. В пуле из 110 подозрительных случаев для MiMo подтверждено 46 masked errors и 9 exposed TTS errors; для CosyVoice - 51 masked и 27 exposed errors. В blind relabeling на 30 случаях точное согласие аннотаторов 23/30, kappa 0.634; в более грубой метке masked versus other - 27/30, kappa 0.800. Для 46 masked ошибок MiMo полноконтекстный ASR оставляет 34/46 surface-correct под обычным режимом и 27/46 под более строгим MiMo-V2-Omni.
Ограничения. Это targeted audit, а не оценка общей частоты ошибок в продакшене: пул специально собран вокруг подозрительных чтений. Для CosyVoice используется тот же Raw-only pool, поэтому сравнение систем ограничено. Изолированные клипы иногда дают no output или другие сбои, что усложняет чистую интерпретацию.
Фишка из статьи. Самая сильная демонстрация - разрез по контексту: одна и та же ошибка становится видимой, если вырезать короткий фрагмент из полной новости.
| Условие для 46 MiMo masked | Exposed | Masked / no output |
|---|---|---|
| Полный исходный текст | 0 | 46 masked, 0 no output |
| Грубый 6-секундный клип | 16 | 11 masked, 17 no output |
| Выровненный клип | 18 | 12 masked, 13 no output |
Как это читать: распознаватель в полном контексте не только слышит звук, но и подставляет ожидаемое чтение по языковой модели. Поэтому roundtrip-метрика может быть слишком доброй к TTS в местах, где человеку слышна ошибка.