Qwen-Audio-3.0-TTS: управляемый синтез речи с 12.5 Гц токенами
Qwen-Audio-3.0-TTS - большой технический отчет о синтезе речи, где упор сделан не только на естественность, но и на управляемость, многоязычность, длинные тексты и устойчивость к шумным подсказкам. Система поддерживает 16 языков и 20 регионов китайских диалектов, а также однопроходный синтез до трех минут. Главный инженерный ход - связать языковую модель речевых токенов, flow-matching акустическую модель и причинный вокодер через многостадийное обучение.
Метод. Речь кодируется низкочастотным токенизатором 12.5 Гц с FSQ-кодбуком 3^10, то есть 59 049 возможных кодов. Затем языковая модель предсказывает семантические речевые токены, flow-matching модель восстанавливает акустические признаки, а причинный вокодер переводит их в waveform. Обучение идет по пяти стадиям: раздельное предварительное обучение, совместная настройка на качественных данных, reinforcement learning для языковой модели, устойчивое обучение acoustic model и отдельная RL-стадия для нее.
Результаты. На SEED-TTS-Eval система показывает CER 0.84 для китайского теста и WER 1.54 для английского, при similarity 0.792 и 0.762 соответственно. В cross-lingual CV3 средняя ошибка 4.05% против 10.09% у CosyVoice3, то есть относительное снижение около 60%. В длинном синтезе по 100 китайским и английским абзацам модель удерживает высокую дикторскую согласованность: S-SIM около 93.16 для китайского и 93.45 для английского.
Ограничения. Отчет сильный по инженерным деталям, но часть данных, оценочных наборов и процедур закрыта. Для некоторых сравнений используются API-бейзлайны, а автоматическая оценка инструкций опирается на Gemini-judge, который на калибровочной подвыборке имел F1 76.2% относительно человека. Поэтому результаты хорошо описывают производственную систему, но не дают полностью воспроизводимого научного протокола.
Фишка из статьи. Интересная техническая развилка - размер кодбука при частоте 12.5 Гц. Авторы показывают, что низкая частота токенов сама по себе не убивает качество, если кодбук достаточно выразительный.
| Токенизатор | Частота | test-zh CER | test-zh SIM | test-en WER | test-en SIM |
|---|---|---|---|---|---|
| Qwen, 6 561 код | 12.5 Гц | 2.59 | 72.44 | 3.21 | 61.64 |
| Qwen, 19 683 кода | 12.5 Гц | 1.48 | 83.25 | 2.56 | 77.58 |
| Qwen, 59 049 кодов | 12.5 Гц | 1.23 | 83.09 | 2.37 | 77.49 |
| CosyVoice3 | 25 Гц | 1.45 | 80.60 | 2.57 | 73.60 |
Как это читать: финальный токенизатор Qwen передает вдвое меньше временных шагов, чем 25 Гц вариант, но выигрывает по ошибке текста и сохраняет близкую дикторскую похожесть. Это важный компромисс для длинного синтеза, где стоимость авторегрессии растет с числом токенов.