корпуса речи многопользовательская речь разговорные системы
arXiv eess.AS

SmoothConv и DuplexConv: взаимодополняющие корпуса китайской многопользовательской разговорной речи

arXiv:2610.11150

SmoothConv и DuplexConv закрывают редкий ресурсный пробел: китайские разговоры двух–четырёх участников с синхронными дорожками каждого человека и разметкой перекрытий, очередности и типов хода. Первый корпус небольшой и проверенный людьми, второй масштабный и автоматически размеченный.

Метод. SmoothConv содержит 100 часов надёжной разметки для анализа и тестирования, DuplexConv — 2000 часов для обучения. Авторы строят общий benchmark для разделения речи, многопользовательского распознавания и определения состояния хода; разделение по говорящим исключает утечку идентичностей.

Результаты. Адаптация SoulX-Transcriber на DuplexConv снижает на SmoothConv DER с 40,89 до 13,50%, cpWER с 27,04 до 17,38%; добавление SmoothConv доводит их до 12,73 и 16,87%. В разделении данных DuplexConv лучше переносится на AliMeeting/AISHELL-4, а смесь с симуляцией удерживает качество на искусственных смесях.

Ограничения. Все данные на мандаринском китайском и покрывают только учебные консультации и социальные беседы. Среднее перекрытие в тесте всего 3,33%. Дальняя AliMeeting остаётся трудной, а состояние wait в benchmark синтетическое, поэтому его распределение может отличаться от живого диалога.

Фишка из статьи. Масштаб и чистота разметки оказываются взаимодополняющими, а не взаимозаменяемыми: автоматические 2000 часов дают основной скачок, но последние 100 проверенных часов улучшают почти все состояния хода и внутридоменную диаризацию.

Обучение MSASRSmoothConv DER, %SmoothConv cpWER, %AliMeeting-near tcpWER, %AliMeeting-far tcpWER, %
Базовая модель40,8927,0411,6525,08
DuplexConv13,5017,387,5630,92
DuplexConv + SmoothConv12,7316,877,4329,76

Как это читать: адаптация резко помогает близкому домену и ближнему микрофону, но ухудшает дальнюю AliMeeting относительно исходной модели. Корпус не отменяет проблему акустического сдвига.

Оригинальная статья на arXiv