многоязычная речь переключение языков интерпретируемость
arXiv cs.CL

Фонологическая интерференция в многоязычных речевых моделях

arXiv:2610.11275

Работа обнаруживает систематическую ошибку многоязычных фонемных моделей: при переключении языка они навязывают всей фразе одну фонологическую систему и теряют звуки, отсутствующие в выбранном языке. Авторы не только измеряют эффект, но и локализуют его в низкоразмерном подпространстве скрытых состояний.

Метод. Для каждой пары языков сравнивается сохранность общих и уникальных фонем при раздельной и совместной обработке. Затем языковое подпространство редактируется напрямую. Исправление WLE заменяет только его координаты оценкой из локального окна длиной около двух секунд, не требуя внешнего идентификатора языка.

Результаты. На код-свитчинге модели теряют 32–79% уникальных фонем; 65–78% потерь превращаются именно в фонемы соседнего языка. WLE устраняет 34–69% интерференции в TTS и 36–58% в двух распознавателях, сохраняя моноязычный PER в пределах ±0,35 п.п.

Ограничения. Эксперименты используют одно переключение между двумя языками и в части случаев искусственно склеенные записи. Метод требует второго прохода по коротким окнам и знания слоёв языкового подпространства. Для невиданных языков причинность проверена слабее, чем для код-свитчинга.

Фишка из статьи. Полное скользящее окно тоже уменьшает интерференцию, но портит моноязычное распознавание на 1–3 п.п. PER. Точечное редактирование 15-мерного языкового подпространства получает почти тот же полезный эффект с пренебрежимо малой побочной ценой.

МодельБез вмешательства: интерференцияWLE: интерференцияУстранено, %
TTS, фиксированное окно0,3020,19934
TTS, окно по сегменту0,3020,09369
PhoneticXeus0,5070,21458
POWSM0,4480,28836

Как это читать: ноль означает отсутствие дополнительной потери при совместной обработке. Оракул с истинным языком всё ещё лучше распознавателей, поэтому качество локальной оценки языка остаётся главным резервом.

Оригинальная статья на arXiv