Диаризация Распознавание речи Qwen-ASR
Разговорное распознавание

Диаризация и Qwen-ASR для распознавания двух дикторов

tcpMER 23.70

Эта работа описывает практическую систему для многоязычного распознавания разговоров с двумя дикторами: сначала запись размечается по говорящим, затем сегменты распознаются адаптированной Qwen3-ASR-1.7B. Интерес статьи не в новой сквозной архитектуре, а в инженерной связке диаризации, синтезированной речи и обучения с вознаграждением для конкретного протокола MLC-SLM 2026. Главный ход - стабилизировать вход для распознавателя через RTTM-разметку и отдельно дообучить модель под двухдикторские диалоги.

Метод. Диаризация собрана в 3D-Speaker: определение речевой активности, короткие подсегменты, векторы говорящих CAMPPlus, спектральная кластеризация с фиксированным числом говорящих, равным двум, и затем нарезка аудио по RTTM. Распознаватель Qwen3-ASR-1.7B обучают в несколько стадий: полная тонкая настройка на официальных данных, LoRA на синтезированной речи OmniVoice и GRPO, где вознаграждение основано на WER/CER, а повторы и галлюцинации штрафуются. Для тайского, японского и корейского авторы используют CER, для остальных языков - WER, чтобы оценка не ломалась на письменностях без пробелов.

Результаты. На проверочной выборке средний tcpMER у полной системы равен 23.70: ниже лучше. Для сравнения, официальная базовая система VibeVoice-ASR LoRA дает 79.15, Whisper-large-v3 - 29.94, Omniasr-LLM-7B-v2 - 31.52, а исходная Qwen-ASR-1.7B без дообучения - 30.53. На финальной оценке соревнования система получила средний tcpMER 17.97. Самые заметные улучшения относительно исходной Qwen-ASR видны на сложных языках: Urdu 102.84 -> 19.77, Tagalog 49.49 -> 33.90; Turkish остается тяжелым случаем с tcpMER 56.02.

Ограничения. Это система для условия с двумя говорящими, причем число говорящих явно фиксируется в кластеризации. Таблица сравнения использует один и тот же выход диаризации для всех распознавателей, поэтому она хорошо изолирует вклад распознавания, но не показывает, насколько метод устойчив к другой диаризации. Размер проверочной части около 4 часов на язык, а выигрыш от GRPO после синтезированной речи небольшой: 23.78 -> 23.70. Авторы также сами отмечают остаточные ошибки на границах реплик и при похожих голосах.

Фишка из статьи. Самое полезное здесь - абляция стадий адаптации. Она показывает, что основной выигрыш дает обычная тонкая настройка на официальных двухдикторских данных, а синтезированная речь и обучение с вознаграждением работают как доводка, а не как главный источник качества.

СистемаСредний tcpMERИзменение
Qwen-ASR-1.7B без дообучения30.53-
+ полная тонкая настройка24.30-6.23
+ LoRA на синтезированной речи23.78-0.52
+ GRPO23.70-0.08

Как это читать: если переносить идею в свою систему, сначала стоит обеспечить качественную разметку говорящих и тонкую настройку под нужный протокол. Синтезированная речь здесь полезна, особенно для слабых языков, но по среднему tcpMER ее вклад намного меньше, чем у базовой адаптации модели.

Оригинальная статья на arXiv