Target speaker extraction DPO WavLM
Выделение целевого голоса

WavLM-якорь для потокового выделения целевого голоса

WER 0.123

Статья решает узкую, но важную проблему потокового выделения целевого говорящего: генеративная модель может делать звук более гладким и «качественным», но терять разборчивость. Авторы показывают, что проблема не в самой потоковой архитектуре, а в плохом критерии предпочтений при дообучении. Их ход - ранжировать варианты не по DNSMOS и не напрямую по WER, а по сходству WavLM-представлений с чистой речью целевого говорящего.

Метод. База - StarTSE с задержкой 560 ms. Модель разделена на семантический путь, который генерирует дискретные смысловые токены, и акустический путь, который восстанавливает кодековые признаки и волну. При DPO авторы обновляют только общий Conformer-энкодер и SELM, а ARLM и декодер кодека замораживают, чтобы не ломать акустическую реконструкцию. Для каждой смеси генерируют 16 кандидатов и строят пары предпочтений по одному из трех критериев: DNSMOS, WER через Whisper LargeV3 или косинусное сходство WavLM с чистой речью.

Результаты. На Libri2Mix модель работает в потоковом режиме с 560 ms chunks и real-time factor 0.181 на NVIDIA L40S или 0.373 на V100. Простое увеличение ядра Conformer до k=15 снижает WER с 0.138 до 0.129. DPO с WavLM-якорем доводит WER до 0.123, то есть дает 10.9% относительного улучшения к исходному StarTSE, при этом DNSMOS OVL остается около 3.122, а сходство WavLM растет до 0.965. Важный отрицательный результат: DPO по DNSMOS дает лучший OVL 3.257, но WER ухудшается до 0.169 и дальше может разваливаться до 0.316.

Ограничения. Эксперимент проведен на Libri2Mix с двухговорящими смесями, поэтому перенос на более шумные многоговорящие сцены, реверберацию и реальные микрофоны еще надо проверять. Пары предпочтений строятся offline, а обучение требует большой инфраструктуры: 10 узлов по 8 V100-32GB. Кроме того, WavLM здесь выступает удобным якорем, но работа не доказывает, что именно он оптимален для всех языков, говорящих и акустических условий.

Фишка из статьи. Главная ценность не в том, что DPO «улучшил метрики», а в сравнении якорей. DNSMOS как критерий предпочтений буквально поощряет сглаживание и стирание согласных, поэтому звук становится приятнее для метрики, но менее разборчивым.

СтратегияDNSMOS OVLWERWavLM similarity
StarTSE3.1170.1380.959
+ Conformer k=153.1210.1290.961
+ DPO по DNSMOS3.2570.1690.953
+ DPO по WER3.1100.1300.966
+ DPO по WavLM3.1220.1230.965

Как это читать: лучшая строка по субъективно-перцептивной метрике не является лучшей для разборчивости. WavLM-якорь работает как более широкий речевой prior: он одновременно удерживает фонетическую структуру, акустическую естественность и похожесть на целевого говорящего.

Оригинальная статья на arXiv