Идентификация языков в речи с переключением кода как предсказание множества меток
Статья рассматривает определение языков внутри смешанной реплики как предсказание множества, когда заранее неизвестно даже число языков. Генератор языковых меток снимает ограничение на заранее перечисленные пары, но опыт честно показывает: возможность представить невиданную комбинацию ещё не означает, что модель сумеет распознать её в живой речи.
Метод. Общий акустический вход MMS-1B используется для четырёх постановок: обычной классификации, атомарных классов языковых пар, независимых sigmoid-оценок и генерации переменного набора языковых токенов. Системы обучаются на FLEURS, синтетическом CS-FLEURS и, в части опытов, шумном CS-YODAS; проверяются известные и невиданные пары, человеческая и синтетическая речь.
Результаты. При известном числе языков sigmoid-классификатор достигает 59,7% точности точного множества на CS-FLEURS, включая 34,2% на невиданных парах. Генератор без знания мощности множества получает 36,6% в целом, 73,5% на известных и 11,1% на невиданных парах. На трёхъязычном подмножестве Multilingual Soap Opera все варианты дают 0%.
Ограничения. Сильнейшие результаты требуют оракула, который заранее сообщает число языков. Синтетическая речь резко проще человеческой, а добавление CS-YODAS не устраняет сдвиг домена. Уровень реплики также скрывает моменты переключения и не заменяет языковую диаризацию.
Фишка из статьи. Генератор на невиданных MMS-парах почти всегда правильно решает, что языков два, но верный набор называет менее чем в трети случаев. Это разделяет две ошибки, которые обычно смешивают: определить количество языков и определить сами языки.
| Модель на MMS, невиданные пары | Предсказывает два языка | Точное множество |
|---|---|---|
| Атомарные классы пар | 38,5% | 0,0% |
| Генератор множества | 96,8% | 28,5% |
| Sigmoid + оракул Top-2 | 100% по определению | 87,3% |
Как это читать: генеративная постановка устраняет структурный запрет на новые пары и хорошо выбирает мощность множества, но пока проигрывает классификатору, которому число языков подсказано. Единого порога вместо Top-2 тоже нет: оптимальные области для одноязычной и смешанной речи почти не пересекаются.