синтез речи галлюцинации повторения
arXiv cs.CL

Повторение, а не длина: локализация ошибки счёта в нейросетевом синтезе речи

arXiv:2609.36974

Когда синтезатор просят повторить слово много раз, он ошибается не потому, что строка длинная. Авторы строят парные фразы одинаковой длины: в одной повторяется тот же элемент, в другой стоят разные слова, и получают разрыв на шести моделях трёх архитектур.

Метод. Число повторов меняется от 1 до 32, а отдельный опыт фиксирует длину и постепенно увеличивает период текста. Счёт проверяет CTC-распознаватель без языковой модели; выводы перепроверены четырьмя распознавателями, 420 вариантами анализа, жадным и стохастическим декодированием.

Результаты. При шести и более повторах контрольные фразы синтезируются с точным числом слов в 94,3% случаев, повторяющиеся только в 18,2%, разрыв 76,1 пункта. С ростом запрошенного числа до 128 медианное фактическое число повторов падает с 25 до 17, тогда как контроль продолжает расти до 66,5.

Ограничения. Оценка автоматическая, без слушательского опыта. Повторяемость не отделена от частоты таких текстов в обучающих данных, а внутренний механизм окончательно не установлен; проверенная гипотеза о схождении состояний к неподвижной точке не подтвердилась.

Фишка из статьи. Ошибка плавно зависит от периода, а не только от соседних одинаковых токенов. При периоде 2 рядом уже нет одинаковых слов, но точность всё ещё лишь 47,9%; при периоде 8 она восстанавливается до 93,1%.

Период текстаТочное число повторов ↑Интерпретация
110,4%одно слово повторяется
247,9%соседних дублей нет
473,6%более разнообразный цикл
893,1%почти уровень контроля

Как это читать: простой штраф за соседний повтор не решает задачу, потому что модель теряет счёт и для чередующихся шаблонов. Правильная общая длительность тоже помогает F5-TTS только ниже 12 повторов.

Оригинальная статья на arXiv