EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis
EmoTra-TTS рассматривает эмоцию не как одну метку на всю реплику, а как траекторию, которая может плавно перейти, например, от радости к грусти внутри предложения. Главная трудность здесь не только в архитектуре, но и в отсутствии размеченных записей с управляемым моментом перехода. Авторы обходят её синтетическими, покадрово согласованными переходами, а затем учат модель воспроизводить их за один проход.
Метод. Один и тот же ряд речевых токенов трижды декодируется потоковой моделью с начальной и конечной эмоциями; полученные мел-спектрограммы совмещаются сигмоидальным плавным перекрытием, поэтому фонемы остаются выровненными по времени. Координаты valence-arousal-dominance задают начальную точку, промежуточные отсчёты и конечную точку. На уровне языковой модели эти отсчёты становятся временными VAD-токенами, а в акустическом декодере покадровая интерполяция модулирует путь представления диктора. Ключевое ограничение инъекции жёстко разделяет направление эмоции и её силу: LayerNorm нормирует выход малого перцептрона, а фиксированный коэффициент задаёт амплитуду. Основной декодер заморожен; обучаются проекция, малый перцептрон и 160 аффинных коэффициентов нормализации.
Результаты. На тесте EmoTra-TTS получает MOS перехода 3,63, MOS соответствия эмоции 3,52, MOS качества 3,54, WER 1,77% и сходство диктора 0,701. У всех открытых базовых систем MOS перехода не превышает 2,80; особенно показателен MOSS-TTS с яркой эмоцией 3,89, но резким переходом 1,94. В парных прослушиваниях против двух коммерческих и четырёх открытых систем доля предпочтений составляет 64,4-79,5%. Модель увеличивает число параметров CosyVoice2 с 639 до 642 млн, а средняя задержка остаётся практически той же: 1,74 против 1,75 с.
Ограничения. Опыты проведены на EmoVoice-DB с ограниченным набором говорящих и языков; для каждого голоса обучается отдельная модель, переноса на незнакомого диктора нет. Слабые различия VAD воспроизводятся нестабильно, а кусочно-линейная траектория лишь грубо приближает естественную динамику эмоций. Обучающие переходы синтетические, поэтому модель может усвоить свойства конкретного потокового декодера и способа смешивания. Прослушивание подтверждает преимущество в этой постановке, но не заменяет проверку на естественно записанных эмоциональных переходах.
Фишка из статьи. Ограничение нормы инъекции даёт измеримый компромисс: небольшая потеря буквальной точности покупает заметно более плавную эмоцию.
| Инъекция | MOS качества | WER | MOS эмоции | MOS перехода |
|---|---|---|---|---|
| Линейная | 3,60 | 1,65% | 3,39 | 3,33 |
| Направление и сила | 3,54 | 1,77% | 3,52 | 3,63 |
Как это читать: выигрыш 0,30 по плавности перехода сопровождается ростом WER всего на 0,12 процентного пункта. Авторы не просто усиливают эмоциональный сигнал, а удерживают его норму, чтобы он не вытеснил содержание речи.