SmoothConv и DuplexConv: взаимодополняющие корпуса китайской многопользовательской разговорной речи
SmoothConv и DuplexConv закрывают редкий ресурсный пробел: китайские разговоры двух–четырёх участников с синхронными дорожками каждого человека и разметкой перекрытий, очередности и типов хода. Первый корпус небольшой и проверенный людьми, второй масштабный и автоматически размеченный.
Метод. SmoothConv содержит 100 часов надёжной разметки для анализа и тестирования, DuplexConv — 2000 часов для обучения. Авторы строят общий benchmark для разделения речи, многопользовательского распознавания и определения состояния хода; разделение по говорящим исключает утечку идентичностей.
Результаты. Адаптация SoulX-Transcriber на DuplexConv снижает на SmoothConv DER с 40,89 до 13,50%, cpWER с 27,04 до 17,38%; добавление SmoothConv доводит их до 12,73 и 16,87%. В разделении данных DuplexConv лучше переносится на AliMeeting/AISHELL-4, а смесь с симуляцией удерживает качество на искусственных смесях.
Ограничения. Все данные на мандаринском китайском и покрывают только учебные консультации и социальные беседы. Среднее перекрытие в тесте всего 3,33%. Дальняя AliMeeting остаётся трудной, а состояние wait в benchmark синтетическое, поэтому его распределение может отличаться от живого диалога.
Фишка из статьи. Масштаб и чистота разметки оказываются взаимодополняющими, а не взаимозаменяемыми: автоматические 2000 часов дают основной скачок, но последние 100 проверенных часов улучшают почти все состояния хода и внутридоменную диаризацию.
| Обучение MSASR | SmoothConv DER, % | SmoothConv cpWER, % | AliMeeting-near tcpWER, % | AliMeeting-far tcpWER, % |
|---|---|---|---|---|
| Базовая модель | 40,89 | 27,04 | 11,65 | 25,08 |
| DuplexConv | 13,50 | 17,38 | 7,56 | 30,92 |
| DuplexConv + SmoothConv | 12,73 | 16,87 | 7,43 | 29,76 |
Как это читать: адаптация резко помогает близкому домену и ближнему микрофону, но ухудшает дальнюю AliMeeting относительно исходной модели. Корпус не отменяет проблему акустического сдвига.