Separate First, Then Associate: A Two-Stage Approach for Real-World Audio-Visual Speech Enhancement
Аудиовизуальное выделение речи обычно встраивает движение губ прямо в сеть-разделитель, поэтому сбой видео портит и само восстановление сигнала. Здесь авторы разводят две задачи: сначала сильная звуковая модель независимо разделяет смесь, а затем зрительно-звуковая модель лишь выбирает выход, соответствующий лицу целевого говорящего. Такой ход особенно интересен для реальных записей с реверберацией, перекрытием реплик и плохим изображением.
Метод. Монофоническая запись 16 кГц с двумя говорящими проходит через TF-GridNet, обученный сначала на Libri2Mix, а затем донастроенный на материалах Real-World AVSE Challenge. Разделитель выдаёт два речевых сигнала без знания целевого лица. На втором этапе audio-visual CLIP сопоставляет каждый сигнал с видеорядом лица и выбирает пару с наибольшим межмодальным сходством. Авторы также проверяют дополнительное обучение на динамически создаваемых смесях, чтобы понять, помогает ли ещё одна порция синтетики реальным записям.
Результаты. На Track 1 для части remix SI-SDR растёт с -5,9 до 10,4 дБ, PESQ с 1,14 до 2,65, STOI с 0,304 до 0,823. На объединённой части CER падает со 102,5% до 16,4%, а сходство говорящего SPK-SIM растёт с 0,328 до 0,737. На более трудном Track 2 получены 9,5 дБ SI-SDR вместо -1,7 дБ, PESQ 2,55 вместо 1,30 и CER 21,1% вместо 105,2%. При этом метод не лучший среди всех участников: на Track 1 лидер даёт 12,7 дБ SI-SDR, то есть работа прежде всего подтверждает жизнеспособность декомпозиции, а не абсолютное первенство.
Ограничения. Постановка жёстко предполагает двух говорящих: если разделитель смешал их в одном выходе или потерял голос, зрительное сопоставление уже ничего не восстановит. Разделитель донастраивается на материалах того же конкурса, поэтому перенос на другие камеры, помещения и число источников не проверен. Нет оценки задержки, вычислительной стоимости и ошибок самого этапа сопоставления; опорные метрики доступны только для remix, а не для естественных mix-записей без чистого эталона.
Фишка из статьи. Дополнительные синтетические смеси не дают ожидаемого универсального улучшения. На Track 1 они слегка ухудшают почти всё, а на Track 2 повышают сохранность личности говорящего ценой качества сигнала.
| Режим | SI-SDR | PESQ | CER, обе части | SPK-SIM, обе части |
|---|---|---|---|---|
| Track 1, основной | 10,4 дБ | 2,65 | 16,4% | 0,737 |
| Track 1, + динамические смеси | 10,0 дБ | 2,63 | 17,7% | 0,732 |
| Track 2, основной | 9,5 дБ | 2,55 | 21,1% | 0,726 |
| Track 2, + динамические смеси | 9,3 дБ | 2,59 | 20,6% | 0,763 |
Как это читать: синтетическое расширение данных не устраняет расхождение с реальными записями автоматически. На Track 2 оно помогает выбрать и сохранить нужного говорящего, но SI-SDR немного снижается, поэтому выигрыш зависит от того, что важнее приложению.