Улучшение речи Разделение Аудио-визуально
arXiv cs.SD

DAVE: аудио-визуальное разделение речи с защитой от плохого видео

arXiv:2608.09288

DAVE нацелен на реальную аудио-визуальную задачу: отделить целевую речь в условиях смеси, шума и ненадежного зрительного сигнала. Авторы не просто добавляют губные признаки в разделитель, а отделяют корпус, обучение и выборочную цепочку улучшения, чтобы зрительный канал не ломал результат при деградации. Работа полезна тем, что показывает полный challenge-style контур, включая данные, метрики и аккуратные постобработки.

Метод. DAVE-Corpus содержит 219 411 реалистичных смесей, собранных из публичных встречевых корпусов с акустическим расширением. Модель TIGER-M обучается прогрессивно: сначала PIT SI-SDR, затем добавляется loss на ошибку распознавания, затем сохранение диктора, затем perceptual losses. После этого certified selective enhancement применяет улучшение только там, где оно не портит reference-based метрики, а loudness normalization стабилизирует уровень без клиппинга.

Результаты. На development-наборе baseline с PIT SI-SDR дает SI-SDR 9.84 дБ, PESQ 2.50, STOI 0.799, UTMOS 1.999, DNSMOS-OVRL 1.624, CER 21.9% и SPK 0.663. Полная цепочка DAVE достигает 10.23 дБ, 2.72, 0.817, 2.81, 2.12, CER 17.1% и SPK 0.726. В официальном leaderboard Real-World AVSE Challenge система не первая по среднему рангу, но заметно сильна по UTMOS/DNSMOS: на Track 1 UTMOS 2.765 и DNSMOS-OVRL 2.022.

Ограничения. Это решение сильно привязано к протоколу конкурса и его метрикам. SI-SDR не лучший среди участников, а certified enhancement может выглядеть как осторожная оптимизация под набор оценок. Нет полноценной субъективной проверки качества, а устойчивость к совсем другим камерам, синхронизации губ и комнатам пока не доказана.

Фишка из статьи. Хорошая деталь статьи - авторы явно показывают, какие компоненты улучшают распознавание, диктора и перцептивные метрики, а какие почти не меняют SI-SDR.

СравнениеЧислоЧто означает
PIT SI-SDR baselineCER 21.9%, SPK 0.663Разделение есть, но речь и диктор страдают
+ CER lossCER 19.3%Обучение начинает беречь разборчивость
+ speaker fidelitySPK 0.697Сходство диктора растет без изменения CER
+ perceptual lossesUTMOS 2.77, DNS 2.02Сдвиг в сторону воспринимаемого качества
+ certified enhancementUTMOS 2.81, DNS 2.12Постобработка улучшает оценку без ухудшения reference-метрик

Как это читать: цепочка важна как инженерный рецепт: в реальном разделении речи одна SI-SDR-цель не покрывает разборчивость, диктора и субъективно похожее качество.

Оригинальная статья на arXiv