DAVE: аудио-визуальное разделение речи с защитой от плохого видео
DAVE нацелен на реальную аудио-визуальную задачу: отделить целевую речь в условиях смеси, шума и ненадежного зрительного сигнала. Авторы не просто добавляют губные признаки в разделитель, а отделяют корпус, обучение и выборочную цепочку улучшения, чтобы зрительный канал не ломал результат при деградации. Работа полезна тем, что показывает полный challenge-style контур, включая данные, метрики и аккуратные постобработки.
Метод. DAVE-Corpus содержит 219 411 реалистичных смесей, собранных из публичных встречевых корпусов с акустическим расширением. Модель TIGER-M обучается прогрессивно: сначала PIT SI-SDR, затем добавляется loss на ошибку распознавания, затем сохранение диктора, затем perceptual losses. После этого certified selective enhancement применяет улучшение только там, где оно не портит reference-based метрики, а loudness normalization стабилизирует уровень без клиппинга.
Результаты. На development-наборе baseline с PIT SI-SDR дает SI-SDR 9.84 дБ, PESQ 2.50, STOI 0.799, UTMOS 1.999, DNSMOS-OVRL 1.624, CER 21.9% и SPK 0.663. Полная цепочка DAVE достигает 10.23 дБ, 2.72, 0.817, 2.81, 2.12, CER 17.1% и SPK 0.726. В официальном leaderboard Real-World AVSE Challenge система не первая по среднему рангу, но заметно сильна по UTMOS/DNSMOS: на Track 1 UTMOS 2.765 и DNSMOS-OVRL 2.022.
Ограничения. Это решение сильно привязано к протоколу конкурса и его метрикам. SI-SDR не лучший среди участников, а certified enhancement может выглядеть как осторожная оптимизация под набор оценок. Нет полноценной субъективной проверки качества, а устойчивость к совсем другим камерам, синхронизации губ и комнатам пока не доказана.
Фишка из статьи. Хорошая деталь статьи - авторы явно показывают, какие компоненты улучшают распознавание, диктора и перцептивные метрики, а какие почти не меняют SI-SDR.
| Сравнение | Число | Что означает |
|---|---|---|
| PIT SI-SDR baseline | CER 21.9%, SPK 0.663 | Разделение есть, но речь и диктор страдают |
| + CER loss | CER 19.3% | Обучение начинает беречь разборчивость |
| + speaker fidelity | SPK 0.697 | Сходство диктора растет без изменения CER |
| + perceptual losses | UTMOS 2.77, DNS 2.02 | Сдвиг в сторону воспринимаемого качества |
| + certified enhancement | UTMOS 2.81, DNS 2.12 | Постобработка улучшает оценку без ухудшения reference-метрик |
Как это читать: цепочка важна как инженерный рецепт: в реальном разделении речи одна SI-SDR-цель не покрывает разборчивость, диктора и субъективно похожее качество.