LILAC: идемпотентный речевой кодек для стабильных аудиотокенов
LILAC разбирает практическую проблему речевых кодеков, которые используются как интерфейс аудиотокенов в генерации и редактировании речи: после декодирования и повторного кодирования токены часто меняются. Авторы показывают, что у двенадцати проверенных кодеков один такой проход переписывает не менее 15% токенов, и строят 24 кГц кодек, у которого корректная токеновая последовательность восстанавливается в точности. Интерес здесь не только в низком битрейте, а в стабильности токенов как контракта между речевой моделью и кодеком.
Метод. LILAC делает идемпотентность конструктивным свойством: декодер и кодировщик устроены так, чтобы звук, полученный из допустимой токеновой последовательности, при повторном кодировании возвращал ровно те же токены. Кодек работает на 24 кГц, использует частоту 9.375 кадра/с, 80 бит на кадр и суммарно 0.75 кбит/с. По сравнению с обычными нейросетевыми аудиокодеками это не просто еще один векторный квантователь, а попытка убрать накопление ошибок в контурах «токены → звук → токены».
Результаты. На LibriSpeech test-clean LILAC дает UTMOS 4.141, dWER 0.101, PESQ 2.60, STOI 0.935 и SI-SNR +2.2 дБ; на LibriTTS-R соответственно UTMOS 4.238, dWER 0.086, PESQ 2.60, STOI 0.944 и SI-SNR +6.0 дБ. В слепом MUSHRA-тесте на 40 слушателях LILAC получил 51.4 балла: ниже DualCodec 1.23 кбит/с с 74.8, но выше FocalCodec 0.65 кбит/с с 48.5 и заметно выше 3.5 кГц якоря с 29.2. Важная проверка: все 7457 тестовых примеров LibriSpeech и LibriTTS-R после декодирования и повторного кодирования вернули исходный поток токенов.
Ограничения. LILAC не становится лучшим кодеком по всем метрикам качества одиночного прохода: некоторые более дорогие или менее стабильные кодеки дают лучшее распознавание или субъективное качество. Работа также не доказывает, что идемпотентность автоматически улучшит большие речевые генераторы, а лишь показывает, что без нее токеновый интерфейс нестабилен. Поэтому практическая ценность особенно велика для многошагового редактирования, самоперекодирования и систем с повторной обработкой аудио, но ее еще нужно проверять в конечных продуктах.
Фишка из статьи. Самый сильный эксперимент не про средний PESQ, а про повторное самоперекодирование. У конкурентов ошибка растет от прохода к проходу, а у LILAC метрики остаются неизменными даже после 100 циклов.
| Кодек | K=1: EER / dWER | K=10: EER / dWER | K=100: EER / dWER |
|---|---|---|---|
| LILAC | 4.00 / 0.103 | 4.00 / 0.103 | 4.00 / 0.103 |
| FocalCodec | 3.00 / 0.072 | 27.00 / 0.489 | 41.00 / 1.335 |
| Mimi | 3.83 / 0.099 | 28.17 / 0.746 | 35.00 / 1.012 |
| DAC | 0.00 / 0.024 | 3.00 / 0.087 | 46.00 / 1.450 |
Как это читать: EER показывает, насколько меняются дикторские признаки, а dWER - насколько ухудшается распознаваемость после кодирования. У LILAC нет накопления деградации, потому что повторное кодирование не меняет токены; у остальных кодеков даже малое начальное отличие постепенно превращается в сильный сдвиг.