идентификация языка переключение кода многоязычная речь
arXiv eess.AS

Идентификация языков в речи с переключением кода как предсказание множества меток

arXiv:2610.01450

Статья рассматривает определение языков внутри смешанной реплики как предсказание множества, когда заранее неизвестно даже число языков. Генератор языковых меток снимает ограничение на заранее перечисленные пары, но опыт честно показывает: возможность представить невиданную комбинацию ещё не означает, что модель сумеет распознать её в живой речи.

Метод. Общий акустический вход MMS-1B используется для четырёх постановок: обычной классификации, атомарных классов языковых пар, независимых sigmoid-оценок и генерации переменного набора языковых токенов. Системы обучаются на FLEURS, синтетическом CS-FLEURS и, в части опытов, шумном CS-YODAS; проверяются известные и невиданные пары, человеческая и синтетическая речь.

Результаты. При известном числе языков sigmoid-классификатор достигает 59,7% точности точного множества на CS-FLEURS, включая 34,2% на невиданных парах. Генератор без знания мощности множества получает 36,6% в целом, 73,5% на известных и 11,1% на невиданных парах. На трёхъязычном подмножестве Multilingual Soap Opera все варианты дают 0%.

Ограничения. Сильнейшие результаты требуют оракула, который заранее сообщает число языков. Синтетическая речь резко проще человеческой, а добавление CS-YODAS не устраняет сдвиг домена. Уровень реплики также скрывает моменты переключения и не заменяет языковую диаризацию.

Фишка из статьи. Генератор на невиданных MMS-парах почти всегда правильно решает, что языков два, но верный набор называет менее чем в трети случаев. Это разделяет две ошибки, которые обычно смешивают: определить количество языков и определить сами языки.

Модель на MMS, невиданные парыПредсказывает два языкаТочное множество
Атомарные классы пар38,5%0,0%
Генератор множества96,8%28,5%
Sigmoid + оракул Top-2100% по определению87,3%

Как это читать: генеративная постановка устраняет структурный запрет на новые пары и хорошо выбирает мощность множества, но пока проигрывает классификатору, которому число языков подсказано. Единого порога вместо Top-2 тоже нет: оптимальные области для одноязычной и смешанной речи почти не пересекаются.

Оригинальная статья на arXiv