Alignment MMS DP
Alignment

Мультиязычный forced alignment слов через MMS, UnSupSeg и обучаемый DP

MMS + UnSupSeg

Группа из Technion (Weber, Zehavi, Rousso, Keshet — Joseph Keshet) опубликовала 9 июня 2026 работу, которая бросает прямой вызов MFA (Montreal Forced Aligner) и BFA как стандартам industry. Это редкая статья — не громкая, но решающая инженерную задачу, на которую все исследователи тратят слишком много времени.

Авторы представляют метод точного мультиязычного word-level forced alignment, состоящий из alignment encoder и обучаемого alignment decoder. Энкодер интегрирует две репрезентации: одну от Massively Multilingual Speech (MMS) модели и другую от self-supervised phoneme boundary detector (UnSupSeg). Он учится сливать их и оценивать вероятности границ слов на длинных временных контекстах.

Контекст. Forced alignment — задача сопоставить аудио и транскрипт по времени: какое слово или фонема происходит в какой момент. Это базовая операция для всего: подготовки TTS-датасетов (нужны точные тайминги для дюрации), оценки качества синтеза, подготовки данных для streaming ASR, для прозодического моделирования. Стандарт — MFA, GMM-HMM-based система, требующая обученной фонетической модели для конкретного языка. Для русского это терпимо (есть готовые ресурсы), для узбекского/казахского — нужно строить с нуля. BFA (Bournemouth Forced Aligner) на основе wav2vec пытался решить мультиязычность, но всё равно требует языкозависимой настройки.

Подход Technion работает иначе. MMS модель даёт мультиязычные акустические репрезентации (она тренирована на 1000+ языках Meta). UnSupSeg — self-supervised детектор фонетических границ, не требующий разметки. Эти две репрезентации сливаются обучаемым модулем, который умеет находить пограничные паттерны независимо от языка. Затем работает learned dynamic programming — нейронная аппроксимация DP-алгоритма выравнивания.

Последний компонент идейно интересен. Классический forced alignment — Viterbi-decoding по HMM, который ищет оптимальный путь через произведение state-transition и emission probabilities. Learned DP заменяет жёсткую DP-структуру на дифференцируемую — модель учит, как именно агрегировать вероятности соседних кадров. Это делает весь pipeline обучаемым end-to-end и позволяет включить long-range context (DP видит не только локальные переходы, но и более широкое окно).

Что это значит для real-world TTS-пайплайнов. Если этот подход даёт качество, сравнимое с MFA для русского и одновременно работает на узбекском/казахском/армянском без отдельной настройки — это большое упрощение мультиязычного TTS-конвейера. Один alignment-инструмент для всех языков, никаких отдельных моделей фонетики, никакой ручной фонемизации. И — потенциально — лучшая точность для редких языков, где MFA-обучение страдает от недостатка данных.

Из связанной работы той же группы — Fully Differentiable Neural Forced Alignment via Soft Dynamic Programming (arXiv:2606.25460), 25 июня 2026. Это родственный пейпер, оформляющий ту же DP-идею в более общую теоретическую конструкцию.

Фишка из статьи. Multilingual word-level forced alignment объединяет MMS, UnSupSeg и обучаемый DP, но обучает DP только на английском. Потом система переносится zero-shot на Hebrew, German и Dutch, причем без G2P, который нужен MFA.

English TIMIT≤10 мс≤25 мс≤50 мс≤100 мс
MWA58.081.391.697.8
MFA41.672.889.497.4
MMS18.643.575.794.7
WhisperX22.452.782.494.2
Canary9.2323.1144.2372.81
Unseen languageМетод≤10 мс≤25 мс≤50 мс≤100 мс
HebrewMWA39.761.173.681.4
HebrewMMS14.341.376.594.7
Dutch IFAMWA29.048.465.376.5
Dutch IFAMFA4.77.311.619.0
German PHONDATMWA32.864.284.793.5
German PHONDATMFA29.965.482.194.3

Ключевой сигнал для практики: MWA особенно выигрывает на точных границах и в языках, где G2P/lexicon инфраструктура слабая или неудобная. UnSupSeg дает 10-мс frame-level признаки границ, MMS - letter/word likelihood, а DP собирает это в word alignment.

Оригинальная статья на arXiv