синтез речи дистилляция компактные модели
arXiv cs.SD

Paradee: дистилляция Kokoro-82M в одноголосную модель синтеза речи на 8 млн параметров

arXiv:2610.06817

Paradee отвечает на практический вопрос: сколько от Kokoro-82M действительно нужно, если требуется один голос на обычном процессоре. Авторы раздельно дистиллируют текстовую и акустическую части, уменьшают модель до 8,07 млн параметров и сохраняют близкую к учителю естественность без совместного дообучения двух половин.

Метод. Kokoro сначала синтезирует 12 000 английских предложений общей длительностью 23,9 часа. Ученик отдельно учится предсказывать длительности, F0, энергию и фонемные признаки учителя, а уменьшенный iSTFTNet-декодер восстанавливает звук по сохранённым признакам. После соединения применяется не обучаемый фильтр фазовой синхронизации, подавляющий слышимый звон в диапазоне 2–8 кГц.

Результаты. У Paradee в 10,1 раза меньше параметров и примерно в 15 раз меньше вычислений: 3,4 против 55 GFLOP на секунду аудио. Версия int8 занимает 8,45 МБ и синтезирует звук в 25 раз быстрее реального времени на одном потоке CPU. UTMOS составляет 4,41 против 4,52 у учителя, WER одинаков и равен 5,7%, а сходство голоса с учителем достигает 0,958.

Ограничения. Эксперимент охватывает один английский голос и данные, полностью сгенерированные учителем. Основная оценка естественности автоматическая; полноценного MOS-теста с независимыми слушателями нет. Модель проверена на Apple M4 Pro, а фильтр добавляет около 5% времени вывода и не устраняет остаточный звон на всех ударных слогах.

Фишка из статьи. Качество маленького декодера определялось не столько шириной сети, сколько балансом спектральной и состязательной функций потерь. При слишком большом весе спектральной ошибки критики почти не влияли на обучение, и естественность оставалась около 3,0.

Вариант декодераUTMOS декодераUTMOS полной модели
Только спектральные потери2,983,00
Состязательное обучение, вес спектральной потери 453,023,00
Вес 104,294,32
Вес 34,374,39
Вес 3 и фазовая синхронизация—4,41

Как это читать: почти весь скачок качества даёт разрешение состязательному сигналу влиять на обучение, а фазовый фильтр прибавляет лишь 0,02 UTMOS. Его ценность в другом: автоматическая метрика почти не замечает характерный звон, который хорошо слышен человеку.

Оригинальная статья на arXiv