Paradee: дистилляция Kokoro-82M в одноголосную модель синтеза речи на 8 млн параметров
Paradee отвечает на практический вопрос: сколько от Kokoro-82M действительно нужно, если требуется один голос на обычном процессоре. Авторы раздельно дистиллируют текстовую и акустическую части, уменьшают модель до 8,07 млн параметров и сохраняют близкую к учителю естественность без совместного дообучения двух половин.
Метод. Kokoro сначала синтезирует 12 000 английских предложений общей длительностью 23,9 часа. Ученик отдельно учится предсказывать длительности, F0, энергию и фонемные признаки учителя, а уменьшенный iSTFTNet-декодер восстанавливает звук по сохранённым признакам. После соединения применяется не обучаемый фильтр фазовой синхронизации, подавляющий слышимый звон в диапазоне 2–8 кГц.
Результаты. У Paradee в 10,1 раза меньше параметров и примерно в 15 раз меньше вычислений: 3,4 против 55 GFLOP на секунду аудио. Версия int8 занимает 8,45 МБ и синтезирует звук в 25 раз быстрее реального времени на одном потоке CPU. UTMOS составляет 4,41 против 4,52 у учителя, WER одинаков и равен 5,7%, а сходство голоса с учителем достигает 0,958.
Ограничения. Эксперимент охватывает один английский голос и данные, полностью сгенерированные учителем. Основная оценка естественности автоматическая; полноценного MOS-теста с независимыми слушателями нет. Модель проверена на Apple M4 Pro, а фильтр добавляет около 5% времени вывода и не устраняет остаточный звон на всех ударных слогах.
Фишка из статьи. Качество маленького декодера определялось не столько шириной сети, сколько балансом спектральной и состязательной функций потерь. При слишком большом весе спектральной ошибки критики почти не влияли на обучение, и естественность оставалась около 3,0.
| Вариант декодера | UTMOS декодера | UTMOS полной модели |
|---|---|---|
| Только спектральные потери | 2,98 | 3,00 |
| Состязательное обучение, вес спектральной потери 45 | 3,02 | 3,00 |
| Вес 10 | 4,29 | 4,32 |
| Вес 3 | 4,37 | 4,39 |
| Вес 3 и фазовая синхронизация | — | 4,41 |
Как это читать: почти весь скачок качества даёт разрешение состязательному сигналу влиять на обучение, а фазовый фильтр прибавляет лишь 0,02 UTMOS. Его ценность в другом: автоматическая метрика почти не замечает характерный звон, который хорошо слышен человеку.