синтез речи клонирование голоса маскированное предсказание
arXiv eess.AS

Tacit-TTS: от авторегрессионного декодирования к маскированному предсказанию для быстрого клонирования голоса без транскрипции

arXiv:2609.38658

Tacit-TTS ускоряет клонирование голоса без транскрипции образца, заменяя авторегрессионную генерацию семантических единиц параллельным маскированным предсказанием. Учителем служит IndexTTS2, но ученик получает голосовую подсказку напрямую из звука и оценивает длину результата сигнальным модулем, поэтому не ждёт последовательного выпуска токенов.

Метод. Текстово-семантический модуль дистиллируется из авторегрессионного учителя и итеративно заполняет маски. Длина оценивается отдельно по фонетическим и просодическим признакам, а преобразование семантики в мел-спектрограмму ускорено методом ReFlow. Один и тот же режим используется для обычного и межъязыкового клонирования, включая неречевые голосовые образцы.

Результаты. На Seed-en модель получает WER 2,34% и сходство говорящего 0,849, на Seed-zh — CER 1,71% и сходство 0,829. Полное время генерации сокращается с 6632 до 977 мс, а собственно генеративная часть — с 6149 до 509 мс. В межъязыковом тесте Tacit-TTS не даёт отказов на восьми языках, тогда как MaskGCT отказывает на русском и арабском.

Ограничения. Измерения сделаны на A100, субъективного прослушивания в основной оценке нет, а учитель на ряде наборов точнее по ошибке текста и сходству. Обучение преимущественно англоязычное; транскрипционно свободная подсказка не означает независимость от языка текста.

Фишка из статьи. Ускорение зависит от длины нелинейно. Параллельное предсказание особенно выгодно для абзаца, но на очень длинной речи выигрыш снижается из-за квадратичного внимания — полезная граница, которую среднее время на коротких репликах скрывает.

Длина результатаУскорение относительно IndexTTS2Причина режима
4 с≈ 9 разПостоянные накладные расходы ещё заметны
Около 30 сдо 14,9 разаЛучший баланс параллельной генерации
125 с≈ 11,8 разаРастёт стоимость полного внимания

Как это читать: маскированное предсказание устраняет линейную авторегрессионную цепочку, но не стоимость внимания; поэтому преимущество остаётся большим, однако не растёт без границы вместе с длительностью.

Оригинальная статья на arXiv