разговорная речь движение тела совместная генерация
arXiv cs.SD

Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue

arXiv:2609.04250

Motion-Omni одновременно порождает разговорную речь и согласованные движения лица, рук, верхней и нижней частей тела, не дожидаясь готовой звуковой волны для отдельного преобразования «звук в движение». Основной инженерный выигрыш — убрать второй последовательный этап и сохранить качество движений учителя при времени ответа быстрее реального масштаба.

Метод. Вариант Motion-Omni-Q7 построен на Qwen2.5-7B. Четыре декодера движения читают скрытые состояния и дискретные единицы речевого генератора: речь идёт с частотой 12,5 Гц, движение — 30 Гц. Обучение проходит четыре стадии: распознавание речи, синтез, синтез с движением и совместная настройка. Учитель LOM разметил 422 856 ответов объёмом 1402 часа; прямое обучение на всей неранжированной выборке расходилось, поэтому данные вводят квартилями качества 12,5/25/50/100%.

Результаты. На Seed-TTS-Eval система получает WER 2,62%, лучший среди сравниваемых универсальных речевых моделей, и 47,63 на VoiceBench. На SwDA-500 она завершает речь вместе с движением за 4,32 с, RTF 0,78, и достигает корреляции ритма 7,59 в табличном масштабе ×10−1. Каскад с тем же звуком и учителем LOM немного выше по ритму — 7,67, но отвечает 23,35 с.

Ограничения. Пространство движений ограничено кодовой книгой и псевдометками LOM, обучение проведено только для одной англоязычной модели без явного управления личностью и эмоцией. Система сначала принимает всю реплику пользователя и потому не является потоковой. Человеческая проверка включает лишь четырёх молодых мужчин и 25 пар на вариант, а большинство автоматических мер сравнивает с тем же учителем.

Фишка из статьи. Согласование через внутренние состояния речи почти сохраняет ритм учительского каскада, но убирает дорогой запуск отдельной модели движения.

СистемаВремя ответа, сRTFКорреляция ритма, ×10−1Замедление
Тот же звук + LOM23,354,397,675,4 раза
Тот же звук + EMAGE4,630,847,321,1 раза
Motion-Omni-Q74,320,787,591,0

Как это читать: интегрированная модель уступает LOM всего 0,08 по корреляции ритма, но работает в 5,4 раза быстрее; при почти одинаковом времени с EMAGE она выигрывает 0,27. Это и есть содержательный результат, а не просто лучший балл движения: узкое место каскада устранено без заметного распада синхронизации.

Оригинальная статья на arXiv