Мультиязычный forced alignment слов через MMS, UnSupSeg и обучаемый DP
Группа из Technion (Weber, Zehavi, Rousso, Keshet — Joseph Keshet) опубликовала 9 июня 2026 работу, которая бросает прямой вызов MFA (Montreal Forced Aligner) и BFA как стандартам industry. Это редкая статья — не громкая, но решающая инженерную задачу, на которую все исследователи тратят слишком много времени.
Авторы представляют метод точного мультиязычного word-level forced alignment, состоящий из alignment encoder и обучаемого alignment decoder. Энкодер интегрирует две репрезентации: одну от Massively Multilingual Speech (MMS) модели и другую от self-supervised phoneme boundary detector (UnSupSeg). Он учится сливать их и оценивать вероятности границ слов на длинных временных контекстах.
Контекст. Forced alignment — задача сопоставить аудио и транскрипт по времени: какое слово или фонема происходит в какой момент. Это базовая операция для всего: подготовки TTS-датасетов (нужны точные тайминги для дюрации), оценки качества синтеза, подготовки данных для streaming ASR, для прозодического моделирования. Стандарт — MFA, GMM-HMM-based система, требующая обученной фонетической модели для конкретного языка. Для русского это терпимо (есть готовые ресурсы), для узбекского/казахского — нужно строить с нуля. BFA (Bournemouth Forced Aligner) на основе wav2vec пытался решить мультиязычность, но всё равно требует языкозависимой настройки.
Подход Technion работает иначе. MMS модель даёт мультиязычные акустические репрезентации (она тренирована на 1000+ языках Meta). UnSupSeg — self-supervised детектор фонетических границ, не требующий разметки. Эти две репрезентации сливаются обучаемым модулем, который умеет находить пограничные паттерны независимо от языка. Затем работает learned dynamic programming — нейронная аппроксимация DP-алгоритма выравнивания.
Последний компонент идейно интересен. Классический forced alignment — Viterbi-decoding по HMM, который ищет оптимальный путь через произведение state-transition и emission probabilities. Learned DP заменяет жёсткую DP-структуру на дифференцируемую — модель учит, как именно агрегировать вероятности соседних кадров. Это делает весь pipeline обучаемым end-to-end и позволяет включить long-range context (DP видит не только локальные переходы, но и более широкое окно).
Что это значит для real-world TTS-пайплайнов. Если этот подход даёт качество, сравнимое с MFA для русского и одновременно работает на узбекском/казахском/армянском без отдельной настройки — это большое упрощение мультиязычного TTS-конвейера. Один alignment-инструмент для всех языков, никаких отдельных моделей фонетики, никакой ручной фонемизации. И — потенциально — лучшая точность для редких языков, где MFA-обучение страдает от недостатка данных.
Из связанной работы той же группы — Fully Differentiable Neural Forced Alignment via Soft Dynamic Programming (arXiv:2606.25460), 25 июня 2026. Это родственный пейпер, оформляющий ту же DP-идею в более общую теоретическую конструкцию.
Фишка из статьи. Multilingual word-level forced alignment объединяет MMS, UnSupSeg и обучаемый DP, но обучает DP только на английском. Потом система переносится zero-shot на Hebrew, German и Dutch, причем без G2P, который нужен MFA.
| English TIMIT | ≤10 мс | ≤25 мс | ≤50 мс | ≤100 мс |
|---|---|---|---|---|
| MWA | 58.0 | 81.3 | 91.6 | 97.8 |
| MFA | 41.6 | 72.8 | 89.4 | 97.4 |
| MMS | 18.6 | 43.5 | 75.7 | 94.7 |
| WhisperX | 22.4 | 52.7 | 82.4 | 94.2 |
| Canary | 9.23 | 23.11 | 44.23 | 72.81 |
| Unseen language | Метод | ≤10 мс | ≤25 мс | ≤50 мс | ≤100 мс |
|---|---|---|---|---|---|
| Hebrew | MWA | 39.7 | 61.1 | 73.6 | 81.4 |
| Hebrew | MMS | 14.3 | 41.3 | 76.5 | 94.7 |
| Dutch IFA | MWA | 29.0 | 48.4 | 65.3 | 76.5 |
| Dutch IFA | MFA | 4.7 | 7.3 | 11.6 | 19.0 |
| German PHONDAT | MWA | 32.8 | 64.2 | 84.7 | 93.5 |
| German PHONDAT | MFA | 29.9 | 65.4 | 82.1 | 94.3 |
Ключевой сигнал для практики: MWA особенно выигрывает на точных границах и в языках, где G2P/lexicon инфраструктура слабая или неудобная. UnSupSeg дает 10-мс frame-level признаки границ, MMS - letter/word likelihood, а DP собирает это в word alignment.