Enhancing Neural Speech Coding with Semantic and Visual Cues
Авторы улучшают нейронный речевой кодек на 6 кбит/с двумя боковыми источниками: смысловыми признаками WavLM и движением губ. Один вариант требует их при декодировании, другой дистиллирует подсказки в основной звуковой тракт и потому не нуждается в видео во время применения.
Метод. Основой служит MDCTCodec для 48 кГц. Смысловая ветвь и зрительные признаки губ объединяются перекрёстным вниманием с кодовыми представлениями. В дистиллированной версии многомодальная модель выступает учителем, а обычный звуковой кодек воспроизводит её промежуточные признаки.
Результаты. На TaL80 полная многомодальная версия получает PESQ 3,37, STOI 0,96 и ViSQOL 4,01 против 3,25, 0,95 и 3,86 у основы. Дистиллированный вариант без боковых входов при выводе достигает 3,29, 0,95 и 3,95. По COVL значения составляют 4,19, 4,10 и 4,06 соответственно.
Ограничения. TaL80 содержит 81 англоязычного говорящего и относительно чистую синхронную запись. Нет субъективного теста, проверки с закрытым ртом, пропавшим видео или рассинхронизацией губ. Изучена одна скорость 6 кбит/с, поэтому неизвестно, сохраняется ли эффект при более сильном сжатии.
Фишка из статьи. Абляция показывает, что смысловая ветвь несёт большую часть выигрыша, а зрение добавляет сравнительно небольшой остаток.
| Вариант | ViSQOL | PESQ |
|---|---|---|
| MDCTCodec | 3,86 | 3,25 |
| Без смысловых признаков | 3,85 | не указано |
| Без зрительных признаков | 3,98 | не указано |
| Полное объединение | 4,01 | 3,37 |
| Дистилляция, только звук при выводе | 3,95 | 3,29 |
Как это читать: удаление WavLM практически возвращает модель к основе, тогда как без губ сохраняется почти весь прирост. Видео полезно, но основной перенос качества идёт через смысловое речевое представление.