Фонологическая интерференция в многоязычных речевых моделях
Работа обнаруживает систематическую ошибку многоязычных фонемных моделей: при переключении языка они навязывают всей фразе одну фонологическую систему и теряют звуки, отсутствующие в выбранном языке. Авторы не только измеряют эффект, но и локализуют его в низкоразмерном подпространстве скрытых состояний.
Метод. Для каждой пары языков сравнивается сохранность общих и уникальных фонем при раздельной и совместной обработке. Затем языковое подпространство редактируется напрямую. Исправление WLE заменяет только его координаты оценкой из локального окна длиной около двух секунд, не требуя внешнего идентификатора языка.
Результаты. На код-свитчинге модели теряют 32–79% уникальных фонем; 65–78% потерь превращаются именно в фонемы соседнего языка. WLE устраняет 34–69% интерференции в TTS и 36–58% в двух распознавателях, сохраняя моноязычный PER в пределах ±0,35 п.п.
Ограничения. Эксперименты используют одно переключение между двумя языками и в части случаев искусственно склеенные записи. Метод требует второго прохода по коротким окнам и знания слоёв языкового подпространства. Для невиданных языков причинность проверена слабее, чем для код-свитчинга.
Фишка из статьи. Полное скользящее окно тоже уменьшает интерференцию, но портит моноязычное распознавание на 1–3 п.п. PER. Точечное редактирование 15-мерного языкового подпространства получает почти тот же полезный эффект с пренебрежимо малой побочной ценой.
| Модель | Без вмешательства: интерференция | WLE: интерференция | Устранено, % |
|---|---|---|---|
| TTS, фиксированное окно | 0,302 | 0,199 | 34 |
| TTS, окно по сегменту | 0,302 | 0,093 | 69 |
| PhoneticXeus | 0,507 | 0,214 | 58 |
| POWSM | 0,448 | 0,288 | 36 |
Как это читать: ноль означает отсутствие дополнительной потери при совместной обработке. Оракул с истинным языком всё ещё лучше распознавателей, поэтому качество локальной оценки языка остаётся главным резервом.