Tacit-TTS: от авторегрессионного декодирования к маскированному предсказанию для быстрого клонирования голоса без транскрипции
Tacit-TTS ускоряет клонирование голоса без транскрипции образца, заменяя авторегрессионную генерацию семантических единиц параллельным маскированным предсказанием. Учителем служит IndexTTS2, но ученик получает голосовую подсказку напрямую из звука и оценивает длину результата сигнальным модулем, поэтому не ждёт последовательного выпуска токенов.
Метод. Текстово-семантический модуль дистиллируется из авторегрессионного учителя и итеративно заполняет маски. Длина оценивается отдельно по фонетическим и просодическим признакам, а преобразование семантики в мел-спектрограмму ускорено методом ReFlow. Один и тот же режим используется для обычного и межъязыкового клонирования, включая неречевые голосовые образцы.
Результаты. На Seed-en модель получает WER 2,34% и сходство говорящего 0,849, на Seed-zh — CER 1,71% и сходство 0,829. Полное время генерации сокращается с 6632 до 977 мс, а собственно генеративная часть — с 6149 до 509 мс. В межъязыковом тесте Tacit-TTS не даёт отказов на восьми языках, тогда как MaskGCT отказывает на русском и арабском.
Ограничения. Измерения сделаны на A100, субъективного прослушивания в основной оценке нет, а учитель на ряде наборов точнее по ошибке текста и сходству. Обучение преимущественно англоязычное; транскрипционно свободная подсказка не означает независимость от языка текста.
Фишка из статьи. Ускорение зависит от длины нелинейно. Параллельное предсказание особенно выгодно для абзаца, но на очень длинной речи выигрыш снижается из-за квадратичного внимания — полезная граница, которую среднее время на коротких репликах скрывает.
| Длина результата | Ускорение относительно IndexTTS2 | Причина режима |
|---|---|---|
| 4 с | ≈ 9 раз | Постоянные накладные расходы ещё заметны |
| Около 30 с | до 14,9 раза | Лучший баланс параллельной генерации |
| 125 с | ≈ 11,8 раза | Растёт стоимость полного внимания |
Как это читать: маскированное предсказание устраняет линейную авторегрессионную цепочку, но не стоимость внимания; поэтому преимущество остаётся большим, однако не растёт без границы вместе с длительностью.