синтез речи артикуляция модель источник–фильтр
arXiv eess.AS

Артикуляторный синтез речи «источник–фильтр»: управление кинематикой речевого тракта

arXiv:2610.00735

Авторы возвращают в нейросетевой синтез явное разделение источника и речевого тракта. Высота и энергия задают возбуждение, псевдоартикуляторные траектории управляют фильтром, поэтому модель можно менять через физически осмысленные движения языка и губ, а не только через неинтерпретируемый стиль.

Метод. Артикуляторная инверсия создаёт траектории по обычной речи без инструментальных датчиков. Текстовый модуль предсказывает эти траектории, источник описывается F0 и энергией, а фильтрующая часть обучается через optimal-transport conditional flow matching. Итоговая модель содержит 33 млн параметров.

Результаты. На LibriTTS test-clean/test-other система получает WER 5,53/7,33%, сходство диктора 0,9366/0,8989 и MOS 3,76/3,65. Корреляция управляемой F0 достигает 0,8841, а при масштабировании энергии — 0,9849–0,9890. По качеству модель уступает крупным непрозрачным системам, но остаётся конкурентной при существенно меньшем размере.

Ограничения. Артикуляция получена другой моделью, а не измерена, поэтому физическая интерпретация приблизительна. Проверена только английская речь; субъективный опыт включает 20 слушателей и 20 примеров на систему. Демонстрация изменения ротического акцента интересна, но не является полноценной оценкой управления акцентом.

Фишка из статьи. Удаление транспортного flow matching даже улучшает WER, но резко портит качество звучания. Это редкий отрицательный результат: оптимизация разборчивости сама по себе не сохраняет естественную работу источника и фильтра.

ВариантWER cleanWER otherUTMOS cleanUTMOS otherMCD
Без OT-CFM4,77%6,40%2,261,996,72
Полная модель5,53%7,33%3,713,535,89

Как это читать: более низкий WER у упрощённого варианта не означает лучшего синтеза. OT-CFM отдаёт около 0,8–0,9 п.п. WER за крупный прирост воспринимаемого качества и меньшую спектральную ошибку.

Оригинальная статья на arXiv