Talking Heads Фонемы 3DGS
arXiv cs.SD

PD-GS: фонемы как опора для артикуляции 3D-аватара

arXiv:2608.05218

PD-GS решает узкое, но важное место в говорящих 3D-аватарах: губы часто сглаживаются и не закрываются там, где фонетика требует жесткой артикуляции. Авторы добавляют к акустическим признакам явные покадровые фонемы, полученные через распознавание речи и принудительное выравнивание. Это делает модель интересной не как очередной рендеринг 3D Gaussian Splatting, а как пример, где дискретная лингвистическая информация помогает геометрии лица.

Метод. Базовая система использует HuBERT-признаки речи и 3D Gaussian Splatting для говорящей головы, обученной по монокулярному видео. PD-GS добавляет словарь из 40 фонемных меток, включая паузы и тишину, и 64-мерное фонемное вложение. Linguistic Fusion Module через обучаемый шлюз смешивает непрерывный акустический контекст и дискретную фонемную подсказку, чтобы сохранять плавность движения, но усиливать артикуляционно критичные участки.

Результаты. На HDTF PD-GS получает LMD 2.66, Sync 8.85, PSNR 33.55, LPIPS 0.027, NIQE 3.61 и BRISQUE 20.77 при размере модели 24 МБ. По геометрии губ он лучше GaussianTalker с LMD 2.71 и заметно лучше Wav2Lip с LMD 5.96, хотя Wav2Lip имеет более высокий Sync 9.13. В субъективной оценке PD-GS получает MOS 4.12 за синхронизацию губ, 4.01 за визуальное качество и 4.07 за естественность.

Ограничения. Фонемы берутся из автоматического распознавания речи и принудительного выравнивания, то есть полный контур не является чисто потоковым. Проверка идет на HDTF и в персонализированной постановке говорящей головы, поэтому перенос на произвольных людей, ошибки выравнивания и многоязычную речь остаются открытыми. Кроме того, Sync-метрика не всегда отражает точность конкретных смычек и закрытий губ.

Фишка из статьи. Абляция показывает, что важна не просто подача фонем, а именно управляемое смешивание фонем и акустики. Если убрать модуль слияния или шлюз, выигрыши по геометрии губ и синхронизации частично исчезают.

ВариантLMD ниже лучшеSync выше лучшеPSNR выше лучше
Без LFM2.738.7133.60
Без шлюза2.708.7833.48
Полный PD-GS2.668.8533.55

Как это читать: LMD измеряет ошибку положения губных ориентиров, а Sync - согласование аудио и видео. Фонемы полезны не как жесткая замена акустики, а как дополнительный дискретный сигнал, который шлюз подключает в моменты артикуляционной неопределенности.

Оригинальная статья на arXiv