Диаризация и Qwen-ASR для распознавания двух дикторов
Эта работа описывает практическую систему для многоязычного распознавания разговоров с двумя дикторами: сначала запись размечается по говорящим, затем сегменты распознаются адаптированной Qwen3-ASR-1.7B. Интерес статьи не в новой сквозной архитектуре, а в инженерной связке диаризации, синтезированной речи и обучения с вознаграждением для конкретного протокола MLC-SLM 2026. Главный ход - стабилизировать вход для распознавателя через RTTM-разметку и отдельно дообучить модель под двухдикторские диалоги.
Метод. Диаризация собрана в 3D-Speaker: определение речевой активности, короткие подсегменты, векторы говорящих CAMPPlus, спектральная кластеризация с фиксированным числом говорящих, равным двум, и затем нарезка аудио по RTTM. Распознаватель Qwen3-ASR-1.7B обучают в несколько стадий: полная тонкая настройка на официальных данных, LoRA на синтезированной речи OmniVoice и GRPO, где вознаграждение основано на WER/CER, а повторы и галлюцинации штрафуются. Для тайского, японского и корейского авторы используют CER, для остальных языков - WER, чтобы оценка не ломалась на письменностях без пробелов.
Результаты. На проверочной выборке средний tcpMER у полной системы равен 23.70: ниже лучше. Для сравнения, официальная базовая система VibeVoice-ASR LoRA дает 79.15, Whisper-large-v3 - 29.94, Omniasr-LLM-7B-v2 - 31.52, а исходная Qwen-ASR-1.7B без дообучения - 30.53. На финальной оценке соревнования система получила средний tcpMER 17.97. Самые заметные улучшения относительно исходной Qwen-ASR видны на сложных языках: Urdu 102.84 -> 19.77, Tagalog 49.49 -> 33.90; Turkish остается тяжелым случаем с tcpMER 56.02.
Ограничения. Это система для условия с двумя говорящими, причем число говорящих явно фиксируется в кластеризации. Таблица сравнения использует один и тот же выход диаризации для всех распознавателей, поэтому она хорошо изолирует вклад распознавания, но не показывает, насколько метод устойчив к другой диаризации. Размер проверочной части около 4 часов на язык, а выигрыш от GRPO после синтезированной речи небольшой: 23.78 -> 23.70. Авторы также сами отмечают остаточные ошибки на границах реплик и при похожих голосах.
Фишка из статьи. Самое полезное здесь - абляция стадий адаптации. Она показывает, что основной выигрыш дает обычная тонкая настройка на официальных двухдикторских данных, а синтезированная речь и обучение с вознаграждением работают как доводка, а не как главный источник качества.
| Система | Средний tcpMER | Изменение |
|---|---|---|
| Qwen-ASR-1.7B без дообучения | 30.53 | - |
| + полная тонкая настройка | 24.30 | -6.23 |
| + LoRA на синтезированной речи | 23.78 | -0.52 |
| + GRPO | 23.70 | -0.08 |
Как это читать: если переносить идею в свою систему, сначала стоит обеспечить качественную разметку говорящих и тонкую настройку под нужный протокол. Синтезированная речь здесь полезна, особенно для слабых языков, но по среднему tcpMER ее вклад намного меньше, чем у базовой адаптации модели.