WavLM-якорь для потокового выделения целевого голоса
Статья решает узкую, но важную проблему потокового выделения целевого говорящего: генеративная модель может делать звук более гладким и «качественным», но терять разборчивость. Авторы показывают, что проблема не в самой потоковой архитектуре, а в плохом критерии предпочтений при дообучении. Их ход - ранжировать варианты не по DNSMOS и не напрямую по WER, а по сходству WavLM-представлений с чистой речью целевого говорящего.
Метод. База - StarTSE с задержкой 560 ms. Модель разделена на семантический путь, который генерирует дискретные смысловые токены, и акустический путь, который восстанавливает кодековые признаки и волну. При DPO авторы обновляют только общий Conformer-энкодер и SELM, а ARLM и декодер кодека замораживают, чтобы не ломать акустическую реконструкцию. Для каждой смеси генерируют 16 кандидатов и строят пары предпочтений по одному из трех критериев: DNSMOS, WER через Whisper LargeV3 или косинусное сходство WavLM с чистой речью.
Результаты. На Libri2Mix модель работает в потоковом режиме с 560 ms chunks и real-time factor 0.181 на NVIDIA L40S или 0.373 на V100. Простое увеличение ядра Conformer до k=15 снижает WER с 0.138 до 0.129. DPO с WavLM-якорем доводит WER до 0.123, то есть дает 10.9% относительного улучшения к исходному StarTSE, при этом DNSMOS OVL остается около 3.122, а сходство WavLM растет до 0.965. Важный отрицательный результат: DPO по DNSMOS дает лучший OVL 3.257, но WER ухудшается до 0.169 и дальше может разваливаться до 0.316.
Ограничения. Эксперимент проведен на Libri2Mix с двухговорящими смесями, поэтому перенос на более шумные многоговорящие сцены, реверберацию и реальные микрофоны еще надо проверять. Пары предпочтений строятся offline, а обучение требует большой инфраструктуры: 10 узлов по 8 V100-32GB. Кроме того, WavLM здесь выступает удобным якорем, но работа не доказывает, что именно он оптимален для всех языков, говорящих и акустических условий.
Фишка из статьи. Главная ценность не в том, что DPO «улучшил метрики», а в сравнении якорей. DNSMOS как критерий предпочтений буквально поощряет сглаживание и стирание согласных, поэтому звук становится приятнее для метрики, но менее разборчивым.
| Стратегия | DNSMOS OVL | WER | WavLM similarity |
|---|---|---|---|
| StarTSE | 3.117 | 0.138 | 0.959 |
| + Conformer k=15 | 3.121 | 0.129 | 0.961 |
| + DPO по DNSMOS | 3.257 | 0.169 | 0.953 |
| + DPO по WER | 3.110 | 0.130 | 0.966 |
| + DPO по WavLM | 3.122 | 0.123 | 0.965 |
Как это читать: лучшая строка по субъективно-перцептивной метрике не является лучшей для разборчивости. WavLM-якорь работает как более широкий речевой prior: он одновременно удерживает фонетическую структуру, акустическую естественность и похожесть на целевого говорящего.