речевые кодеки звуковые токены порождающие модели
arXiv eess.AS

Rethinking Speech Codecs: From Compression to Autoregressive Generative Modeling

arXiv:2609.04237

Статья предлагает оценивать речевой кодек не только по восстановлению волны, но и по тому, насколько удобно языковой модели предсказывать его токены. Для этого первый, преимущественно смысловой слой делают более редким, а кодовые последовательности дополнительно обучают авторегрессионной предсказуемости.

Метод. В XCodec вводится неодинаковое временное прореживание: первый слой идёт с частотой 6,25 Гц, остальные — 12,5 Гц. Авторегрессионный штраф приближает распределение кодов к структуре, удобной для 8-миллиардной Llama. Кодек обучают на LibriSpeech и китайской Common Voice, а звуковую языковую модель — примерно на 400 тыс. часов китайской речи.

Результаты. Полная схема повышает StoryCloze с 63,7% до 70,1% и тематическую классификацию с 72,3% до 76,9%; CER на AISHELL падает с 5,2% до 2,5%, WER синтеза SeedTTS — с 4,7% до 2,3%. При этом обычное восстановление почти не меняется: PESQ 3,53 против 3,50, STOI 0,95 в обоих случаях, UTMOS 4,30 против 4,24.

Ограничения. Обучение звуковой LLM требует 32 A100 и огромного китайского корпуса, поэтому трудно отделить свойство кодека от масштаба. Причинная связь между «законом Ципфа» кодов и качеством генерации заявлена сильнее, чем доказана. В рукописи остались шаблонные фрагменты оформления, что тоже требует осторожности.

Фишка из статьи. Два изменения по отдельности дают почти одинаковый средний эффект, а вместе складываются существенно лучше.

ВариантStoryCloze, %Темы, %AISHELL CER, %SeedTTS WER, %
Исходный XCodec63,772,35,24,7
Только авторегрессионный штраф67,074,24,23,5
Только разная частота слоёв67,174,73,83,4
Оба изменения70,176,92,52,3

Как это читать: улучшение нельзя свести лишь к более редкому смысловому слою или лишь к регуляризации. Кодек одновременно сокращает длинную зависимость и делает оставшиеся токены предсказуемее.

Оригинальная статья на arXiv