Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech
Работа управляет произношением иноязычной вставки внутри одной синтезированной фразы без дообучения: основная часть сохраняет свой язык, а вставка получает произношение целевого языка. Ключевой ход — локализовать языковую контрастную подсказку по кадрам, а не направлять ею всю реплику.
Метод. Для дискретной диффузионной модели авторы извлекают границы вставки из её собственных карт самовнимания, расширяют маску около перехода и объединяют оценки двух языковых условий. Внутри маски логиты усиливаются разностью между целевым и основным языком с коэффициентом λ. Проверка включает 1200 синтетических реплик, пять языков и 12 направлений переключения.
Результаты. При λ=7 смешанная ошибка MER снижается с 0,564 до 0,445, точность языка вставки LAe растёт с 0,233 до 0,518, а уверенность распознавания языка LIDe — с 0,247 до 0,588. Сходство говорящего меняется лишь с 0,973 до 0,969, но UTMOS падает с 3,411 до 3,285. В прослушивании японско- и корейско-английских направлений новый вариант получил 292 победы против 95 у исходного и 101 ничью; MOS всей реплики равен 3,931 против 4,007 с перекрывающимися доверительными интервалами.
Ограничения. Основной корпус написан языковой моделью, голоса одноязычные, а слушательская проверка охватывает только два направления в английский. Метод привязан к дискретному диффузионному синтезу и требует знать символьный диапазон вставки; перенос на авторегрессионные модели не показан. Наконец, «более родное» произношение не всегда желательная цель для естественного переключения языков.
Фишка из статьи. Точная внешняя разметка границ оказалась хуже расширенной маски, извлечённой из внимания самой модели.
| Маска | MER ниже лучше | LAe выше лучше |
|---|---|---|
| Без локального управления | 0,564 | 0,233 |
| Внешнее принудительное выравнивание | 0,472 | 0,459 |
| Внимание модели, M4+XU | 0,445 | 0,518 |
Как это читать: принудительное выравнивание точнее по формальной границе, но обрезает переходные кадры, необходимые для произношения. Диффузионный синтез лучше переносит небольшое расширение области, чем потерю начала или конца вставки.