ReLMCodec: речевой кодек с более предсказуемыми токенами
ReLMCodec смотрит на речевой кодек не только как на средство восстановления волны, а как на интерфейс для авторегрессионной языковой модели. Авторы показывают, что фонемная структура до квантования связана с тем, насколько легко предсказывать будущие дискретные токены. Новизна в постановке компромисса: кодек должен сохранять акустические детали, но не разрушать языковую геометрию признаков.
Метод. Метод строится по схеме preserve-control-refine. Замороженные SSL-признаки сохраняют фонемную организацию на входе квантователя, акустическая ветка добавляет информацию для восстановления, PAPA ограничивает дрейф относительно SSL-якоря, а JMAS использует учителя WavLM-Large L24 для структурного уточнения. Важное отличие от обычной донастройки кодека: обучаемая ветка не должна переписать якорь, а только добавить остаток.
Результаты. При 800 бит/с ReLMCodec@64K улучшает X-Codec2 по WER/SIM/PESQ: 3.96/0.804/2.40 против 5.53/0.801/2.13. В абляции 8K-конфигурации переход от прямой адаптации C0 к полной C3 поднимает P-ACC с 3.15% до 9.63% и снижает WER с 4.65 до 4.16, хотя SIM и PESQ немного уступают C0. В downstream-синтезе ReLMCodec C3 при 8K и 50 токенах/с дает WER 4.30 и UTMOS 4.25, лучше C1 по разборчивости, но с небольшой потерей SIM.
Ограничения. Анализ в основном английский и привязан к 50-Гц представлениям LibriSpeech. Выбор SSL-учителей ограничен W2v-BERT 2.0 и WavLM-Large L24; шумные, многоязычные и другие частоты токенизации остаются будущей работой. Кроме того, часть выигрыша оценивается через прокси-языковую модель токенов, а не через полный стек речевой LLM.
Фишка из статьи. Особенно показателен отрицательный результат: фонемная структура сама по себе не дает хороший кодек, если нет акустической ветки.
| Сравнение | Число | Что означает |
|---|---|---|
| SSL-only A0 | P-ACC 12.45%, WER 8.31 | Токены предсказуемы, но волна восстанавливается плохо |
| Direct C0 | P-ACC 3.15%, WER 4.65 | Качество лучше, но языковая структура проседает |
| PAPA C1 | P-ACC 8.16%, WER 4.33 | Якорь возвращает предсказуемость |
| PAPA+JMAS C3 | P-ACC 9.63%, WER 4.16 | Лучший баланс в выбранной рабочей точке |
Как это читать: если строить токенизатор для речевой языковой модели, нельзя оптимизировать только PESQ или только фонемную разделимость. Нужен режим, где языковая структура и акустическая достаточность удерживаются одновременно.