FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations
FireRedTTS3 пытается сохранить преимущество непрерывных речевых представлений - отсутствие потерь от квантования - и одновременно уменьшить накопление ошибок при авторегрессионном продолжении. Главный ход сделан не усложнением генератора, а на уровне представления: автоэнкодер RedAE обучают под надзором замороженного звукового кодировщика, уже знающего распознавание речи и голос говорящего. На одном основании затем строятся клонирование голоса, управление стилем по инструкции и локальное редактирование записи.
Метод. RedAE выдаёт непрерывные признаки с частотой 25 кадров в секунду и получает дополнительную среднеквадратичную потерю к признакам семантического учителя. Декодер речи и кодировщик RedAE обучаются совместно, без отдельной дискретизации. В генераторе связаны языковая модель Qwen3-1.7B и DiT, восстанавливающий речевые признаки; версия Base также получает вектор говорящего CAM++. Версия Instruct сначала превращает свободную инструкцию в план из 12 акустических атрибутов либо в новую расшифровку и маску редактируемого участка. Масштаб обучения очень велик: RedAE использует 500 тысяч часов звука и 32 H800, Base проходит этап на 2,6 млн часов китайской и английской речи и этап на 560 тысячах часов 24 языков, а Instruct дополнительно получает 330 тысяч часов данных управления и редактирования.
Результаты. На Seed-TTS-Eval средняя ошибка WER/CER равна 3,04%, а сходство голоса - 78,8%; это лучшие средние значения среди приведённых систем, хотя на отдельных языках другие модели точнее. На MiniMax-MLS-Test по 24 языкам средняя ошибка составляет 3,75%, сходство - 84,8%; первое или второе место по сходству получено для 22 языков. В InstructTTSEval точность следования инструкциям достигает 85,8/82,0/69,7% для трёх китайских режимов и 80,7/82,3/72,0% для английских. При свободном семантическом редактировании средняя точность операции составляет 87,27% для китайского и 78,91% для английского.
Ограничения. Работа почти не позволяет отделить вклад семантического учителя от масштаба данных: развёрнутой абляции RedAE без этого ограничения нет. Нет субъективного прослушивания MOS или MUSHRA, а качество оценивают распознавателями, вектором сходства говорящего и Gemini-оценщиком следования инструкции. Не приведены скорость генерации, RTF, задержка и память полной системы. Миллионы часов данных и десятки H800 делают независимое воспроизведение затруднительным. Наконец, заявленная устойчивость к накоплению ошибок не подтверждена отдельным испытанием длинной речи или графиком роста ошибки по времени.
Фишка из статьи. Наиболее наглядно система выигрывает не в обычном клонировании, а при акустическом редактировании: она меняет темп, высоту или громкость и заметно лучше сохраняет слова и голос.
| Операция | Показатель | Ming-UniAudio-Edit, ZH / EN | FireRedTTS3, ZH / EN |
|---|---|---|---|
| Изменение темпа | WER | 5,88% / 17,53% | 2,27% / 4,75% |
| Изменение темпа | Ошибка длительности | 6,36% / 5,92% | 4,35% / 4,29% |
| Изменение высоты | WER | 7,45% / 13,37% | 2,34% / 2,94% |
| Изменение громкости | Ошибка амплитуды | 14,90% / 11,70% | 3,58% / 4,44% |
Как это читать: преимущество особенно велико там, где изменение акустики обычно повреждает разборчивость. Но таблица всё ещё основана на автоматических показателях; она не отвечает, звучит ли результат естественно и нет ли слышимого шва на границе редактирования.