Аудиовизуальная обработка Разделение речи Реальные записи
arXiv eess.AS

Separate First, Then Associate: A Two-Stage Approach for Real-World Audio-Visual Speech Enhancement

arXiv:2608.14812

Аудиовизуальное выделение речи обычно встраивает движение губ прямо в сеть-разделитель, поэтому сбой видео портит и само восстановление сигнала. Здесь авторы разводят две задачи: сначала сильная звуковая модель независимо разделяет смесь, а затем зрительно-звуковая модель лишь выбирает выход, соответствующий лицу целевого говорящего. Такой ход особенно интересен для реальных записей с реверберацией, перекрытием реплик и плохим изображением.

Метод. Монофоническая запись 16 кГц с двумя говорящими проходит через TF-GridNet, обученный сначала на Libri2Mix, а затем донастроенный на материалах Real-World AVSE Challenge. Разделитель выдаёт два речевых сигнала без знания целевого лица. На втором этапе audio-visual CLIP сопоставляет каждый сигнал с видеорядом лица и выбирает пару с наибольшим межмодальным сходством. Авторы также проверяют дополнительное обучение на динамически создаваемых смесях, чтобы понять, помогает ли ещё одна порция синтетики реальным записям.

Результаты. На Track 1 для части remix SI-SDR растёт с -5,9 до 10,4 дБ, PESQ с 1,14 до 2,65, STOI с 0,304 до 0,823. На объединённой части CER падает со 102,5% до 16,4%, а сходство говорящего SPK-SIM растёт с 0,328 до 0,737. На более трудном Track 2 получены 9,5 дБ SI-SDR вместо -1,7 дБ, PESQ 2,55 вместо 1,30 и CER 21,1% вместо 105,2%. При этом метод не лучший среди всех участников: на Track 1 лидер даёт 12,7 дБ SI-SDR, то есть работа прежде всего подтверждает жизнеспособность декомпозиции, а не абсолютное первенство.

Ограничения. Постановка жёстко предполагает двух говорящих: если разделитель смешал их в одном выходе или потерял голос, зрительное сопоставление уже ничего не восстановит. Разделитель донастраивается на материалах того же конкурса, поэтому перенос на другие камеры, помещения и число источников не проверен. Нет оценки задержки, вычислительной стоимости и ошибок самого этапа сопоставления; опорные метрики доступны только для remix, а не для естественных mix-записей без чистого эталона.

Фишка из статьи. Дополнительные синтетические смеси не дают ожидаемого универсального улучшения. На Track 1 они слегка ухудшают почти всё, а на Track 2 повышают сохранность личности говорящего ценой качества сигнала.

РежимSI-SDRPESQCER, обе частиSPK-SIM, обе части
Track 1, основной10,4 дБ2,6516,4%0,737
Track 1, + динамические смеси10,0 дБ2,6317,7%0,732
Track 2, основной9,5 дБ2,5521,1%0,726
Track 2, + динамические смеси9,3 дБ2,5920,6%0,763

Как это читать: синтетическое расширение данных не устраняет расхождение с реальными записями автоматически. На Track 2 оно помогает выбрать и сохранить нужного говорящего, но SI-SDR немного снижается, поэтому выигрыш зависит от того, что важнее приложению.

Оригинальная статья на arXiv