Повторение, а не длина: локализация ошибки счёта в нейросетевом синтезе речи
Когда синтезатор просят повторить слово много раз, он ошибается не потому, что строка длинная. Авторы строят парные фразы одинаковой длины: в одной повторяется тот же элемент, в другой стоят разные слова, и получают разрыв на шести моделях трёх архитектур.
Метод. Число повторов меняется от 1 до 32, а отдельный опыт фиксирует длину и постепенно увеличивает период текста. Счёт проверяет CTC-распознаватель без языковой модели; выводы перепроверены четырьмя распознавателями, 420 вариантами анализа, жадным и стохастическим декодированием.
Результаты. При шести и более повторах контрольные фразы синтезируются с точным числом слов в 94,3% случаев, повторяющиеся только в 18,2%, разрыв 76,1 пункта. С ростом запрошенного числа до 128 медианное фактическое число повторов падает с 25 до 17, тогда как контроль продолжает расти до 66,5.
Ограничения. Оценка автоматическая, без слушательского опыта. Повторяемость не отделена от частоты таких текстов в обучающих данных, а внутренний механизм окончательно не установлен; проверенная гипотеза о схождении состояний к неподвижной точке не подтвердилась.
Фишка из статьи. Ошибка плавно зависит от периода, а не только от соседних одинаковых токенов. При периоде 2 рядом уже нет одинаковых слов, но точность всё ещё лишь 47,9%; при периоде 8 она восстанавливается до 93,1%.
| Период текста | Точное число повторов ↑ | Интерпретация |
|---|---|---|
| 1 | 10,4% | одно слово повторяется |
| 2 | 47,9% | соседних дублей нет |
| 4 | 73,6% | более разнообразный цикл |
| 8 | 93,1% | почти уровень контроля |
Как это читать: простой штраф за соседний повтор не решает задачу, потому что модель теряет счёт и для чередующихся шаблонов. Правильная общая длительность тоже помогает F5-TTS только ниже 12 повторов.