Yoruba TTS: правила тона вместо большой нейросети
Эта работа интересна не модельным масштабом, а аккуратной лингвистической инженерией для тонального low-resource языка. TTSYoruba синтезирует имена Yoruba через diphone-инвентарь и правила тонов, включая контурные варианты, syllabic nasals и расширения орфографии. Такой подход полезен там, где большой нейросетевой TTS трудно обучить, а ошибки тона меняют воспринимаемую правильность имени.
Метод. Система использует записанный diphone-инвентарь: 18 согласных x 7 гласных дают 126 CV-пар, каждая имеет пять тональных вариантов. Суффиксы файлов кодируют low, mid, high, falling и rising тоны; отдельно записаны 21 word-initial vowel units. Правила выбирают нужный файл по окружению: например, falling tone появляется после high/rising или при circumflex, rising - после low/falling или при caron. Для syllabic nasal есть отдельные правила disambiguation, чтобы не путать носовой слог и обычный сегмент.
Результаты. Listening study включает 50 участников и 500 оценок по шкале 1-5 для naturalness и intelligibility. Overall naturalness равен 4.08 (SD 0.98), intelligibility 4.55 (SD 0.72). Стандартные тональные имена получают 4.15/4.60, syllabic nasal 3.90/4.48, geminated contour 4.10/4.52, caron/circumflex 4.14/4.60. То есть разборчивость высокая во всех категориях, а естественность ниже именно на более сложной фонологии.
Ограничения. Это не открытый универсальный TTS, а синтезатор для персональных имен и близких форм. Инвентарь записан одним мужским диктором, без сравнения с нейросетевой baseline и без широкой проверки на фразовой речи. Оценка MOS полезна, но небольшая; часть участников слушала с телефонного динамика, что может сгладить различия в естественности.
Фишка из статьи. Сильная деталь - явная кодировка пяти тональных реализаций на уровне файлов. Это делает систему грубой по сравнению с neural TTS, но хорошо отлаживаемой: ошибка тона становится ошибкой правила выбора, а не скрытого embedding-а.
| Категория имени | Naturalness MOS | Intelligibility MOS | Что проверяется |
|---|---|---|---|
| Standard tonal | 4.15 (0.92) | 4.60 (0.68) | обычные тональные имена |
| Syllabic nasal | 3.90 (0.97) | 4.48 (0.72) | носовые слоги |
| Geminated contour | 4.10 (1.01) | 4.52 (0.80) | контурный тон через удвоение |
| Caron/circumflex | 4.14 (1.02) | 4.60 (0.69) | расширенная орфография |
Как это читать: система почти везде понятна слушателям, но naturalness особенно проседает на syllabic nasal. Это показывает, где rule-based TTS стоит улучшать в первую очередь: не в общем синтезе сегментов, а в переходах и контурных тональных реализациях.