речевые кодеки чтение по губам смысловые признаки
arXiv eess.AS

Enhancing Neural Speech Coding with Semantic and Visual Cues

arXiv:2609.05076

Авторы улучшают нейронный речевой кодек на 6 кбит/с двумя боковыми источниками: смысловыми признаками WavLM и движением губ. Один вариант требует их при декодировании, другой дистиллирует подсказки в основной звуковой тракт и потому не нуждается в видео во время применения.

Метод. Основой служит MDCTCodec для 48 кГц. Смысловая ветвь и зрительные признаки губ объединяются перекрёстным вниманием с кодовыми представлениями. В дистиллированной версии многомодальная модель выступает учителем, а обычный звуковой кодек воспроизводит её промежуточные признаки.

Результаты. На TaL80 полная многомодальная версия получает PESQ 3,37, STOI 0,96 и ViSQOL 4,01 против 3,25, 0,95 и 3,86 у основы. Дистиллированный вариант без боковых входов при выводе достигает 3,29, 0,95 и 3,95. По COVL значения составляют 4,19, 4,10 и 4,06 соответственно.

Ограничения. TaL80 содержит 81 англоязычного говорящего и относительно чистую синхронную запись. Нет субъективного теста, проверки с закрытым ртом, пропавшим видео или рассинхронизацией губ. Изучена одна скорость 6 кбит/с, поэтому неизвестно, сохраняется ли эффект при более сильном сжатии.

Фишка из статьи. Абляция показывает, что смысловая ветвь несёт большую часть выигрыша, а зрение добавляет сравнительно небольшой остаток.

ВариантViSQOLPESQ
MDCTCodec3,863,25
Без смысловых признаков3,85не указано
Без зрительных признаков3,98не указано
Полное объединение4,013,37
Дистилляция, только звук при выводе3,953,29

Как это читать: удаление WavLM практически возвращает модель к основе, тогда как без губ сохраняется почти весь прирост. Видео полезно, но основной перенос качества идёт через смысловое речевое представление.

Оригинальная статья на arXiv