Синтез речи Редактирование речи Непрерывные представления
arXiv cs.SD

FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations

arXiv:2608.17492

FireRedTTS3 пытается сохранить преимущество непрерывных речевых представлений - отсутствие потерь от квантования - и одновременно уменьшить накопление ошибок при авторегрессионном продолжении. Главный ход сделан не усложнением генератора, а на уровне представления: автоэнкодер RedAE обучают под надзором замороженного звукового кодировщика, уже знающего распознавание речи и голос говорящего. На одном основании затем строятся клонирование голоса, управление стилем по инструкции и локальное редактирование записи.

Метод. RedAE выдаёт непрерывные признаки с частотой 25 кадров в секунду и получает дополнительную среднеквадратичную потерю к признакам семантического учителя. Декодер речи и кодировщик RedAE обучаются совместно, без отдельной дискретизации. В генераторе связаны языковая модель Qwen3-1.7B и DiT, восстанавливающий речевые признаки; версия Base также получает вектор говорящего CAM++. Версия Instruct сначала превращает свободную инструкцию в план из 12 акустических атрибутов либо в новую расшифровку и маску редактируемого участка. Масштаб обучения очень велик: RedAE использует 500 тысяч часов звука и 32 H800, Base проходит этап на 2,6 млн часов китайской и английской речи и этап на 560 тысячах часов 24 языков, а Instruct дополнительно получает 330 тысяч часов данных управления и редактирования.

Результаты. На Seed-TTS-Eval средняя ошибка WER/CER равна 3,04%, а сходство голоса - 78,8%; это лучшие средние значения среди приведённых систем, хотя на отдельных языках другие модели точнее. На MiniMax-MLS-Test по 24 языкам средняя ошибка составляет 3,75%, сходство - 84,8%; первое или второе место по сходству получено для 22 языков. В InstructTTSEval точность следования инструкциям достигает 85,8/82,0/69,7% для трёх китайских режимов и 80,7/82,3/72,0% для английских. При свободном семантическом редактировании средняя точность операции составляет 87,27% для китайского и 78,91% для английского.

Ограничения. Работа почти не позволяет отделить вклад семантического учителя от масштаба данных: развёрнутой абляции RedAE без этого ограничения нет. Нет субъективного прослушивания MOS или MUSHRA, а качество оценивают распознавателями, вектором сходства говорящего и Gemini-оценщиком следования инструкции. Не приведены скорость генерации, RTF, задержка и память полной системы. Миллионы часов данных и десятки H800 делают независимое воспроизведение затруднительным. Наконец, заявленная устойчивость к накоплению ошибок не подтверждена отдельным испытанием длинной речи или графиком роста ошибки по времени.

Фишка из статьи. Наиболее наглядно система выигрывает не в обычном клонировании, а при акустическом редактировании: она меняет темп, высоту или громкость и заметно лучше сохраняет слова и голос.

ОперацияПоказательMing-UniAudio-Edit, ZH / ENFireRedTTS3, ZH / EN
Изменение темпаWER5,88% / 17,53%2,27% / 4,75%
Изменение темпаОшибка длительности6,36% / 5,92%4,35% / 4,29%
Изменение высотыWER7,45% / 13,37%2,34% / 2,94%
Изменение громкостиОшибка амплитуды14,90% / 11,70%3,58% / 4,44%

Как это читать: преимущество особенно велико там, где изменение акустики обычно повреждает разборчивость. Но таблица всё ещё основана на автоматических показателях; она не отвечает, звучит ли результат естественно и нет ли слышимого шва на границе редактирования.

Оригинальная статья на arXiv