Locodec: редкие continuous tokens для устойчивой генерации речи
Эта статья атакует типичный конфликт в авторегрессионной генерации речи: частые токены дают подробный сигнал, но длинная последовательность накапливает ошибки, а слишком сжатые токены делают генерацию стабильнее ценой качества. Авторы предлагают Locodec: локальный аудиокодек с редкими, примерно 8-Гц, но 768-мерными непрерывными токенами. Идея интересна тем, что представление одновременно короткое по времени и широкое по полосе, а устойчивость поддерживается геометрией пространства токенов и специальным генератором MP-ELD.
Метод. Locodec работает с 24 кГц стерео и использует MDCT: соседние MDCT-кадры группируются в один токен, поэтому частота токенов получается около 8.5 Гц. Кодек полностью локальный: он не опирается на внешние модели самоконтролируемого обучения, распознавания речи или текстовые языковые модели. Пространство токенов формируется сферической нормализацией, шумом вращения, низкоразмерным ядром и postfix dimension dropout. Для генерации используется MP-ELD, авторегрессионный flow-matching генератор с несколькими путями передачи информации и остаточным classifier-free guidance.
Результаты. На реконструкции Seed-TTS-eval полные 768-мерные токены сохраняют высокую разборчивость: например, для варианта dcore=32 без PDD китайский WER равен 1.32%, STOI 0.98, ViSQOL 4.68, SIM 0.741; для английского WER 2.15%, STOI 0.98, ViSQOL 4.67, SIM 0.716. В генерации лучший вариант 32/PDD с CFG-L дает WER 0.95% и SIM 0.687 для китайского, WER 1.87% и SIM 0.615 для английского; на длинных примерах WER 4.61% при глобальном SIM 0.731. Это конкурентно по разборчивости, хотя по похожести голоса сильные системы вроде dots.tts и VoxCPM2 остаются выше.
Ограничения. Работа в основном про синтез речи, а не про широкий звук; результат проверен на 24 кГц и внутренних двуязычных данных. Авторы сознательно не используют внешние речевые модели и постобучение, поэтому сравнение с промышленными системами не полностью равное. Длинные примеры измеряются десятками секунд, а не часами. Субъективной оценки качества в духе MOS в ключевых таблицах нет, поэтому часть выводов держится на автоматических метриках WER, SIM, STOI и ViSQOL.
Фишка из статьи. Самое содержательное наблюдение связано с долгой генерацией: более агрессивный guidance может сначала улучшать локальную похожесть голоса, но быстрее терять устойчивость по мере продолжения речи. В таблице ниже один и тот же вариант 32/PDD сравнивается при разных режимах residual classifier-free guidance.
| Режим | Long WER | Global SIM | SIM в начале | SIM в конце |
|---|---|---|---|---|
| CFG-L | 4.61% | 0.731 | 0.740 | 0.672 |
| CFG-M | 4.79% | 0.727 | 0.740 | 0.659 |
| CFG-S | 9.73% | 0.724 | 0.758 | 0.578 |
Как это читать: CFG-S стартует с лучшего сегментного SIM 0.758, но к последнему сегменту падает до 0.578 и почти удваивает WER относительно CFG-L. Это редкий полезный пример, где средняя похожесть не рассказывает всей истории: для длинного синтеза важнее не первый красивый отрезок, а удержание траектории токенов.