Синтез речи Audio tokens Кодек
Генерация речи

Locodec: редкие continuous tokens для устойчивой генерации речи

8 Hz tokens

Эта статья атакует типичный конфликт в авторегрессионной генерации речи: частые токены дают подробный сигнал, но длинная последовательность накапливает ошибки, а слишком сжатые токены делают генерацию стабильнее ценой качества. Авторы предлагают Locodec: локальный аудиокодек с редкими, примерно 8-Гц, но 768-мерными непрерывными токенами. Идея интересна тем, что представление одновременно короткое по времени и широкое по полосе, а устойчивость поддерживается геометрией пространства токенов и специальным генератором MP-ELD.

Метод. Locodec работает с 24 кГц стерео и использует MDCT: соседние MDCT-кадры группируются в один токен, поэтому частота токенов получается около 8.5 Гц. Кодек полностью локальный: он не опирается на внешние модели самоконтролируемого обучения, распознавания речи или текстовые языковые модели. Пространство токенов формируется сферической нормализацией, шумом вращения, низкоразмерным ядром и postfix dimension dropout. Для генерации используется MP-ELD, авторегрессионный flow-matching генератор с несколькими путями передачи информации и остаточным classifier-free guidance.

Результаты. На реконструкции Seed-TTS-eval полные 768-мерные токены сохраняют высокую разборчивость: например, для варианта dcore=32 без PDD китайский WER равен 1.32%, STOI 0.98, ViSQOL 4.68, SIM 0.741; для английского WER 2.15%, STOI 0.98, ViSQOL 4.67, SIM 0.716. В генерации лучший вариант 32/PDD с CFG-L дает WER 0.95% и SIM 0.687 для китайского, WER 1.87% и SIM 0.615 для английского; на длинных примерах WER 4.61% при глобальном SIM 0.731. Это конкурентно по разборчивости, хотя по похожести голоса сильные системы вроде dots.tts и VoxCPM2 остаются выше.

Ограничения. Работа в основном про синтез речи, а не про широкий звук; результат проверен на 24 кГц и внутренних двуязычных данных. Авторы сознательно не используют внешние речевые модели и постобучение, поэтому сравнение с промышленными системами не полностью равное. Длинные примеры измеряются десятками секунд, а не часами. Субъективной оценки качества в духе MOS в ключевых таблицах нет, поэтому часть выводов держится на автоматических метриках WER, SIM, STOI и ViSQOL.

Фишка из статьи. Самое содержательное наблюдение связано с долгой генерацией: более агрессивный guidance может сначала улучшать локальную похожесть голоса, но быстрее терять устойчивость по мере продолжения речи. В таблице ниже один и тот же вариант 32/PDD сравнивается при разных режимах residual classifier-free guidance.

РежимLong WERGlobal SIMSIM в началеSIM в конце
CFG-L4.61%0.7310.7400.672
CFG-M4.79%0.7270.7400.659
CFG-S9.73%0.7240.7580.578

Как это читать: CFG-S стартует с лучшего сегментного SIM 0.758, но к последнему сегменту падает до 0.578 и почти удваивает WER относительно CFG-L. Это редкий полезный пример, где средняя похожесть не рассказывает всей истории: для длинного синтеза важнее не первый красивый отрезок, а удержание траектории токенов.

Оригинальная статья на arXiv