Rethinking Speech Codecs: From Compression to Autoregressive Generative Modeling
Статья предлагает оценивать речевой кодек не только по восстановлению волны, но и по тому, насколько удобно языковой модели предсказывать его токены. Для этого первый, преимущественно смысловой слой делают более редким, а кодовые последовательности дополнительно обучают авторегрессионной предсказуемости.
Метод. В XCodec вводится неодинаковое временное прореживание: первый слой идёт с частотой 6,25 Гц, остальные — 12,5 Гц. Авторегрессионный штраф приближает распределение кодов к структуре, удобной для 8-миллиардной Llama. Кодек обучают на LibriSpeech и китайской Common Voice, а звуковую языковую модель — примерно на 400 тыс. часов китайской речи.
Результаты. Полная схема повышает StoryCloze с 63,7% до 70,1% и тематическую классификацию с 72,3% до 76,9%; CER на AISHELL падает с 5,2% до 2,5%, WER синтеза SeedTTS — с 4,7% до 2,3%. При этом обычное восстановление почти не меняется: PESQ 3,53 против 3,50, STOI 0,95 в обоих случаях, UTMOS 4,30 против 4,24.
Ограничения. Обучение звуковой LLM требует 32 A100 и огромного китайского корпуса, поэтому трудно отделить свойство кодека от масштаба. Причинная связь между «законом Ципфа» кодов и качеством генерации заявлена сильнее, чем доказана. В рукописи остались шаблонные фрагменты оформления, что тоже требует осторожности.
Фишка из статьи. Два изменения по отдельности дают почти одинаковый средний эффект, а вместе складываются существенно лучше.
| Вариант | StoryCloze, % | Темы, % | AISHELL CER, % | SeedTTS WER, % |
|---|---|---|---|---|
| Исходный XCodec | 63,7 | 72,3 | 5,2 | 4,7 |
| Только авторегрессионный штраф | 67,0 | 74,2 | 4,2 | 3,5 |
| Только разная частота слоёв | 67,1 | 74,7 | 3,8 | 3,4 |
| Оба изменения | 70,1 | 76,9 | 2,5 | 2,3 |
Как это читать: улучшение нельзя свести лишь к более редкому смысловому слою или лишь к регуляризации. Кодек одновременно сокращает длинную зависимость и делает оставшиеся токены предсказуемее.