Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder
Confucius4-TTS клонирует голос между 14 языками без расшифровки опорной записи. Это снимает неудобное требование многих систем нулевого переноса: сначала точно распознать чужой язык, хотя сама задача состоит в сохранении тембра, а не содержания подсказки.
Метод. Система разделена на авторегрессионный модуль текст-в-семантику и модуль семантика-в-звук на основе согласования потоков. Обучаемый кодировщик говорящего извлекает тембр из признаков w2v-BERT 2.0 и совместно обучается с языковой моделью; отдельная расшифровка опорного звука не нужна. Если текст подсказки известен, доступен режим продолжения. Корпус содержит около 500 тысяч часов реальной и синтетической речи; синтетические данные фильтруются по ошибке внешнего распознавателя ниже 2,5%.
Результаты. На шести направлениях CV3-Eval средняя ошибка равна 3,73%: например, английский в китайский - 6,16%, японский в китайский - 4,87%, корейский в китайский - 1,28%, китайский в английский - 3,19%. В японско-китайском направлении CosyVoice2 получает 48,10%, что подчеркивает сложность переноса. На Seed-TTS режим без текста подсказки дает WER 1,49% и SIM 0,700 для английского, CER 0,94% и SIM 0,765 для китайского; режим продолжения повышает сходство до 0,715/0,766, но ошибку - до 1,68%/1,15%.
Ограничения. Публичное межъязыковое сравнение в основном измеряет целевые китайский и английский, поэтому заявленные 14 языков проверены неравномерно. Субъективное ранжирование проведено на внутреннем наборе с ограниченным описанием протокола. Масштаб и состав 500 тысяч часов трудно воспроизвести; нет измерений задержки или потоковой работы. Режим продолжения не доминирует: небольшая прибавка сходства часто покупается ростом ошибок текста.
Фишка из статьи. Сравнение двух режимов отделяет сохранение тембра от разборчивости и показывает реальную цену известной расшифровки подсказки.
| Язык | Режим подсказки | WER/CER | SIM |
|---|---|---|---|
| Английский | Без расшифровки | 1,49% | 0,700 |
| Английский | Продолжение с текстом | 1,68% | 0,715 |
| Китайский | Без расшифровки | 0,94% | 0,765 |
| Китайский | Продолжение с текстом | 1,15% | 0,766 |
Как это читать: известный текст подсказки не делает систему безусловно лучше. Для английского SIM растет на 0,015, но WER ухудшается на 0,19 пункта; для китайского прирост сходства почти нулевой при росте CER на 0,21 пункта.