PD-GS: фонемы как опора для артикуляции 3D-аватара
PD-GS решает узкое, но важное место в говорящих 3D-аватарах: губы часто сглаживаются и не закрываются там, где фонетика требует жесткой артикуляции. Авторы добавляют к акустическим признакам явные покадровые фонемы, полученные через распознавание речи и принудительное выравнивание. Это делает модель интересной не как очередной рендеринг 3D Gaussian Splatting, а как пример, где дискретная лингвистическая информация помогает геометрии лица.
Метод. Базовая система использует HuBERT-признаки речи и 3D Gaussian Splatting для говорящей головы, обученной по монокулярному видео. PD-GS добавляет словарь из 40 фонемных меток, включая паузы и тишину, и 64-мерное фонемное вложение. Linguistic Fusion Module через обучаемый шлюз смешивает непрерывный акустический контекст и дискретную фонемную подсказку, чтобы сохранять плавность движения, но усиливать артикуляционно критичные участки.
Результаты. На HDTF PD-GS получает LMD 2.66, Sync 8.85, PSNR 33.55, LPIPS 0.027, NIQE 3.61 и BRISQUE 20.77 при размере модели 24 МБ. По геометрии губ он лучше GaussianTalker с LMD 2.71 и заметно лучше Wav2Lip с LMD 5.96, хотя Wav2Lip имеет более высокий Sync 9.13. В субъективной оценке PD-GS получает MOS 4.12 за синхронизацию губ, 4.01 за визуальное качество и 4.07 за естественность.
Ограничения. Фонемы берутся из автоматического распознавания речи и принудительного выравнивания, то есть полный контур не является чисто потоковым. Проверка идет на HDTF и в персонализированной постановке говорящей головы, поэтому перенос на произвольных людей, ошибки выравнивания и многоязычную речь остаются открытыми. Кроме того, Sync-метрика не всегда отражает точность конкретных смычек и закрытий губ.
Фишка из статьи. Абляция показывает, что важна не просто подача фонем, а именно управляемое смешивание фонем и акустики. Если убрать модуль слияния или шлюз, выигрыши по геометрии губ и синхронизации частично исчезают.
| Вариант | LMD ниже лучше | Sync выше лучше | PSNR выше лучше |
|---|---|---|---|
| Без LFM | 2.73 | 8.71 | 33.60 |
| Без шлюза | 2.70 | 8.78 | 33.48 |
| Полный PD-GS | 2.66 | 8.85 | 33.55 |
Как это читать: LMD измеряет ошибку положения губных ориентиров, а Sync - согласование аудио и видео. Фонемы полезны не как жесткая замена акустики, а как дополнительный дискретный сигнал, который шлюз подключает в моменты артикуляционной неопределенности.