Синтез речи Yoruba Low-resource
Синтез речи

Yoruba TTS: правила тона вместо большой нейросети

MOS 4.55

Эта работа интересна не модельным масштабом, а аккуратной лингвистической инженерией для тонального low-resource языка. TTSYoruba синтезирует имена Yoruba через diphone-инвентарь и правила тонов, включая контурные варианты, syllabic nasals и расширения орфографии. Такой подход полезен там, где большой нейросетевой TTS трудно обучить, а ошибки тона меняют воспринимаемую правильность имени.

Метод. Система использует записанный diphone-инвентарь: 18 согласных x 7 гласных дают 126 CV-пар, каждая имеет пять тональных вариантов. Суффиксы файлов кодируют low, mid, high, falling и rising тоны; отдельно записаны 21 word-initial vowel units. Правила выбирают нужный файл по окружению: например, falling tone появляется после high/rising или при circumflex, rising - после low/falling или при caron. Для syllabic nasal есть отдельные правила disambiguation, чтобы не путать носовой слог и обычный сегмент.

Результаты. Listening study включает 50 участников и 500 оценок по шкале 1-5 для naturalness и intelligibility. Overall naturalness равен 4.08 (SD 0.98), intelligibility 4.55 (SD 0.72). Стандартные тональные имена получают 4.15/4.60, syllabic nasal 3.90/4.48, geminated contour 4.10/4.52, caron/circumflex 4.14/4.60. То есть разборчивость высокая во всех категориях, а естественность ниже именно на более сложной фонологии.

Ограничения. Это не открытый универсальный TTS, а синтезатор для персональных имен и близких форм. Инвентарь записан одним мужским диктором, без сравнения с нейросетевой baseline и без широкой проверки на фразовой речи. Оценка MOS полезна, но небольшая; часть участников слушала с телефонного динамика, что может сгладить различия в естественности.

Фишка из статьи. Сильная деталь - явная кодировка пяти тональных реализаций на уровне файлов. Это делает систему грубой по сравнению с neural TTS, но хорошо отлаживаемой: ошибка тона становится ошибкой правила выбора, а не скрытого embedding-а.

Категория имениNaturalness MOSIntelligibility MOSЧто проверяется
Standard tonal4.15 (0.92)4.60 (0.68)обычные тональные имена
Syllabic nasal3.90 (0.97)4.48 (0.72)носовые слоги
Geminated contour4.10 (1.01)4.52 (0.80)контурный тон через удвоение
Caron/circumflex4.14 (1.02)4.60 (0.69)расширенная орфография

Как это читать: система почти везде понятна слушателям, но naturalness особенно проседает на syllabic nasal. Это показывает, где rule-based TTS стоит улучшать в первую очередь: не в общем синтезе сегментов, а в переходах и контурных тональных реализациях.

Оригинальная статья на arXiv