FreyaTTS: компактный турецкий синтез речи без фонемизатора
FreyaTTS - турецко-ориентированная модель синтеза речи, сделанная не как маленький хвост большой многоязычной системы, а как отдельная компактная система для языка со сложной морфологией. Модель не использует фонемизатор, G2P-frontend или дискретные речевые токены: она читает 92-символьный турецкий алфавит и генерирует непрерывные латенты. Главный ход - оставить AudioVAE2 замороженным для восстановления 48 kHz звука, а все 183.2M параметров потратить на отображение текста в латентную речь.
Метод. FreyaTTS работает в 25 Hz, 64-мерном непрерывном латентном пространстве AudioVAE2: вход кодируется на 16 kHz, выход декодируется в 48 kHz, сам кодек не обучается. Поверх него стоит неавторегрессионный conditional flow-matching Diffusion Transformer, который предсказывает длительность и за 32 шага Euler denoising строит всю последовательность латентов параллельно. После предобучения используется двухшаговое доведение до продукта: voice-lock на одном согласованном дикторе записывает голос в параметры, а этап short-utterance coverage исправляет однословные и короткие фразы.
Результаты. На Freya-TR-Eval из 495 турецких предложений FreyaTTS получает WER 8.0%, CER 3.0% и MOS 3.68. Она лучше крупных открытых zero-shot систем по распознавательной оценке: XTTS-v2 имеет WER 11.1%, CER 3.9%, MOS 3.82, а F5-TTS Turkish - WER 24.3%, CER 10.9%, MOS 3.63. При этом маленькие VITS-бейзлайны Piper и MMS-TTS имеют более низкий WER 4.4% и 6.8%, но более низкий MOS 3.47 и 3.58. Voice-lock снижает стандартное отклонение F0 между перегенерациями с 74.9 Hz до 5.0 Hz; ECAPA-сходство с целевым говорящим 0.873 +/- 0.029 почти достигает потолка same-speaker 0.883 +/- 0.026.
Ограничения. Это single-voice модель, а не zero-shot клонирование: на входе нет референсного голоса. Главная автоматическая метрика - Whisper WER/CER, поэтому она измеряет удобство распознавания синтеза, а не всю естественность. MOS-интервалы верхних систем пересекаются, так что ранжирование по естественности нужно читать осторожно. Для digit-dense входа все еще требуется spoken-form expansion, голос наследует узкополосное ограничение исходного диктора, а оценка сосредоточена на одном языке и одном собственном benchmark.
Фишка из статьи. Практически важна таблица задержек и памяти: модель маленькая не только на бумаге. В обычном released-режиме FreyaTTS держит низкий RTF и малую память, а батчевый ODE-server резко повышает throughput.
| Система | Параметры | VRAM | RTF med | Throughput |
|---|---|---|---|---|
| FreyaTTS | 183M | 1.5 GB | 0.11 | 9.4 аудио-с/с |
| F5-TTS Turkish | 336M | 0.8 GB | 0.13 | 8.4 аудио-с/с |
| XTTS-v2 | 470M | 2.2 GB | 0.33 | 3.4 аудио-с/с |
| VoxCPM2 | 2B | 5.5 GB | 0.37 | 1.7 аудио-с/с |
| FreyaTTS batched ODE | 183M | 3.8 GB | - | 65.2 аудио-с/с |
Как это читать: non-autoregressive схема не просто ускоряет отдельный короткий пример, а хорошо батчится. Это делает FreyaTTS интересной не как самая универсальная TTS-модель, а как инженерно удобная турецкая production-модель с малой задержкой и памятью.