Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization
Phoenix TTS атакует разрыв между речевым токенизатором и акустическим декодером. Вместо независимого обучения дискретных токенов на распознавании речи токенизатор одновременно восстанавливает самоконтролируемые признаки и получает градиент от модели согласования потоков, поэтому его коды сохраняют и содержание, и детали голоса.
Метод. UniSpeechTokenizer работает с частотой 25 Гц, восстанавливает признаки W2v-BERT 2.0 и совместно оптимизируется с акустическим декодером. Авторегрессионная языковая часть построена на Qwen2.5-0.5B и предсказывает семантические токены по тексту и опорному голосу; затем согласование потоков восстанавливает спектрограмму. Та же связка без дополнительного обучения выполняет преобразование голоса. Корпус состоит из 110 тысяч часов китайской и английской речи.
Результаты. На LibriSpeech-PC Phoenix получает WER 1,94% и SIM 0,718, на SeedTTS-EN - 1,56%/0,720, на SeedTTS-ZH - 1,16%/0,778. Субъективное сходство SMOS равно 4,09 для английского и 4,10 для китайского при 4,22/4,24 у оригинала. В преобразовании голоса токенизатор при 25 Гц дает WER 2,54%, SIM 0,697 и UTMOS 4,081; раздельное обучение ухудшает их до 2,70%, 0,682 и 4,036.
Ограничения. Проверены только китайский и английский, потоковая работа и задержка не измерены. Часть чисел базовых систем пересчитана авторами по открытым контрольным точкам, а объемы их обучения различаются. WER ниже исходной записи частично отражает свойства внешнего распознавателя и не означает, что синтез объективно естественнее человека. Общий корпус велик и подробно не воспроизводится.
Фишка из статьи. Абляция показывает, что глобальный вектор говорящего может немного улучшить китайскую разборчивость, но заметно стирает индивидуальность. А разрыв обучения токенизатора и декодера прежде всего бьет по устойчивости текста.
| Вариант | EN WER | EN SIM | ZH WER | ZH SIM |
|---|---|---|---|---|
| Phoenix TTS | 1,56% | 0,720 | 1,16% | 0,778 |
| Предобученный глобальный вектор говорящего | 1,92% | 0,625 | 0,95% | 0,762 |
| Без звуковой подсказки | 2,20% | 0,422 | 2,70% | 0,560 |
| Без совместного обучения | 2,36% | 0,706 | 1,33% | 0,764 |
Как это читать: фиксированный вектор говорящего в китайском снижает WER с 1,16% до 0,95%, но SIM падает с 0,778 до 0,762, а в английском - с 0,720 до 0,625. Тонкие временные признаки подсказки действительно несут больше тембра, чем один глобальный вектор.