Синтез речи Речевой токенизатор Преобразование голоса
arXiv cs.SD

Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization

arXiv:2608.11737

Phoenix TTS атакует разрыв между речевым токенизатором и акустическим декодером. Вместо независимого обучения дискретных токенов на распознавании речи токенизатор одновременно восстанавливает самоконтролируемые признаки и получает градиент от модели согласования потоков, поэтому его коды сохраняют и содержание, и детали голоса.

Метод. UniSpeechTokenizer работает с частотой 25 Гц, восстанавливает признаки W2v-BERT 2.0 и совместно оптимизируется с акустическим декодером. Авторегрессионная языковая часть построена на Qwen2.5-0.5B и предсказывает семантические токены по тексту и опорному голосу; затем согласование потоков восстанавливает спектрограмму. Та же связка без дополнительного обучения выполняет преобразование голоса. Корпус состоит из 110 тысяч часов китайской и английской речи.

Результаты. На LibriSpeech-PC Phoenix получает WER 1,94% и SIM 0,718, на SeedTTS-EN - 1,56%/0,720, на SeedTTS-ZH - 1,16%/0,778. Субъективное сходство SMOS равно 4,09 для английского и 4,10 для китайского при 4,22/4,24 у оригинала. В преобразовании голоса токенизатор при 25 Гц дает WER 2,54%, SIM 0,697 и UTMOS 4,081; раздельное обучение ухудшает их до 2,70%, 0,682 и 4,036.

Ограничения. Проверены только китайский и английский, потоковая работа и задержка не измерены. Часть чисел базовых систем пересчитана авторами по открытым контрольным точкам, а объемы их обучения различаются. WER ниже исходной записи частично отражает свойства внешнего распознавателя и не означает, что синтез объективно естественнее человека. Общий корпус велик и подробно не воспроизводится.

Фишка из статьи. Абляция показывает, что глобальный вектор говорящего может немного улучшить китайскую разборчивость, но заметно стирает индивидуальность. А разрыв обучения токенизатора и декодера прежде всего бьет по устойчивости текста.

ВариантEN WEREN SIMZH WERZH SIM
Phoenix TTS1,56%0,7201,16%0,778
Предобученный глобальный вектор говорящего1,92%0,6250,95%0,762
Без звуковой подсказки2,20%0,4222,70%0,560
Без совместного обучения2,36%0,7061,33%0,764

Как это читать: фиксированный вектор говорящего в китайском снижает WER с 1,16% до 0,95%, но SIM падает с 0,778 до 0,762, а в английском - с 0,720 до 0,625. Тонкие временные признаки подсказки действительно несут больше тембра, чем один глобальный вектор.

Оригинальная статья на arXiv