The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge
Эта работа интересна прежде всего не новым алгоритмом улучшения речи, а более честной постановкой задачи. Вместо привычного сложения независимо записанных реплик авторы включают естественные разговоры двух людей, где одновременно действуют перекрытие голосов, акустика помещения, окружающий шум и тракт записи; параллельный синтетический сценарий сохраняет чистую цель для измерений. Отдельный трек проверяет, что произойдёт, если видеоподсказка запаздывает, пропадает или закрывает рот говорящего.
Метод. В Track 1 есть естественные смеси без чистого эталона и искусственные ремиксы с отношением уровней от -5 до 5 дБ. Track 2 оставляет звук прежним, но добавляет размытие или шум видео, перекрытие лица, замораживание кадров, рассинхронизацию и затемнение; отдельно включены записи с расстояния около 3 м. Всего участвуют 14 китайскоязычных дикторов, причём люди в обучающей и проверочной частях не пересекаются. Базовый непотоковый AV-ConvTasNet объединяет звуковой кодировщик с замороженным ResNet-34 для области губ и обучается по перестановочно-инвариантной цели SI-SDR/SNR. Для ремиксов доступны SI-SDR, PESQ и STOI, а для обоих сценариев используются UTMOS, DNSMOS, CER и сходство голоса с эталонным отпечатком.
Результаты. В Track 1 опубликовано 4 284 целевых примера для разработки и 8 514 для проверки, в Track 2 - 5 250 и 9 882. Базовый вариант намеренно слаб: на ремиксах Track 1 он получает SI-SDR -4,07 дБ, PESQ 1,15 и STOI 0,388 при разработке, а на проверке -5,93 дБ, 1,14 и 0,304. В Track 2 соответствующие значения равны -2,85 дБ, 1,26 и 0,470, а на проверке -1,69 дБ, 1,30 и 0,502. Отрицательный SI-SDR означает, что отделённый сигнал всё ещё сильно отличается от чистой цели. При этом CER Track 1 ухудшается с 0,773 до 1,025 между частями, так что перенос на незнакомых говорящих и сцены оказывается существенной частью задачи.
Ограничения. Корпус мал по числу говорящих и ограничен китайской речью. Большинство видеоповреждений создано искусственно, а дальнее поле меняет сразу и звук, и изображение, поэтому агрегированные результаты двух треков нельзя трактовать как чистый опыт по отказу видео. У естественных смесей нет чистой волны, UTMOS и DNSMOS являются обученными предикторами, а не оценками слушателей. Кроме того, разрешены внешние данные, поэтому итоговая таблица может отражать доступные ресурсы не меньше, чем сам алгоритм.
Фишка из статьи. Естественная смесь выглядит лучше синтетического ремикса по некоторым безэталонным показателям, хотя для неё невозможно проверить точность восстановления волны.
| Трек | Сцена | DNS-OVRL | CER |
|---|---|---|---|
| 1 | Естественная смесь | 1,672 | 0,735 |
| 1 | Ремикс | 1,499 | 0,825 |
| 2 | Естественная смесь | 1,449 | 0,866 |
| 2 | Ремикс | 1,322 | 0,878 |
Как это читать: более высокий DNS-OVRL и более низкий CER формально предпочитают естественную смесь. Это не доказывает лучшего разделения источников: предиктор качества и распознавание чувствительны к другим свойствам сигнала. Главный практический вывод протокола - нельзя сворачивать качество такой системы в одну цифру.