Кодек речи Аудиотокены Idempotence
arXiv cs.SD

LILAC: идемпотентный речевой кодек для стабильных аудиотокенов

arXiv:2608.05727

LILAC разбирает практическую проблему речевых кодеков, которые используются как интерфейс аудиотокенов в генерации и редактировании речи: после декодирования и повторного кодирования токены часто меняются. Авторы показывают, что у двенадцати проверенных кодеков один такой проход переписывает не менее 15% токенов, и строят 24 кГц кодек, у которого корректная токеновая последовательность восстанавливается в точности. Интерес здесь не только в низком битрейте, а в стабильности токенов как контракта между речевой моделью и кодеком.

Метод. LILAC делает идемпотентность конструктивным свойством: декодер и кодировщик устроены так, чтобы звук, полученный из допустимой токеновой последовательности, при повторном кодировании возвращал ровно те же токены. Кодек работает на 24 кГц, использует частоту 9.375 кадра/с, 80 бит на кадр и суммарно 0.75 кбит/с. По сравнению с обычными нейросетевыми аудиокодеками это не просто еще один векторный квантователь, а попытка убрать накопление ошибок в контурах «токены → звук → токены».

Результаты. На LibriSpeech test-clean LILAC дает UTMOS 4.141, dWER 0.101, PESQ 2.60, STOI 0.935 и SI-SNR +2.2 дБ; на LibriTTS-R соответственно UTMOS 4.238, dWER 0.086, PESQ 2.60, STOI 0.944 и SI-SNR +6.0 дБ. В слепом MUSHRA-тесте на 40 слушателях LILAC получил 51.4 балла: ниже DualCodec 1.23 кбит/с с 74.8, но выше FocalCodec 0.65 кбит/с с 48.5 и заметно выше 3.5 кГц якоря с 29.2. Важная проверка: все 7457 тестовых примеров LibriSpeech и LibriTTS-R после декодирования и повторного кодирования вернули исходный поток токенов.

Ограничения. LILAC не становится лучшим кодеком по всем метрикам качества одиночного прохода: некоторые более дорогие или менее стабильные кодеки дают лучшее распознавание или субъективное качество. Работа также не доказывает, что идемпотентность автоматически улучшит большие речевые генераторы, а лишь показывает, что без нее токеновый интерфейс нестабилен. Поэтому практическая ценность особенно велика для многошагового редактирования, самоперекодирования и систем с повторной обработкой аудио, но ее еще нужно проверять в конечных продуктах.

Фишка из статьи. Самый сильный эксперимент не про средний PESQ, а про повторное самоперекодирование. У конкурентов ошибка растет от прохода к проходу, а у LILAC метрики остаются неизменными даже после 100 циклов.

КодекK=1: EER / dWERK=10: EER / dWERK=100: EER / dWER
LILAC4.00 / 0.1034.00 / 0.1034.00 / 0.103
FocalCodec3.00 / 0.07227.00 / 0.48941.00 / 1.335
Mimi3.83 / 0.09928.17 / 0.74635.00 / 1.012
DAC0.00 / 0.0243.00 / 0.08746.00 / 1.450

Как это читать: EER показывает, насколько меняются дикторские признаки, а dWER - насколько ухудшается распознаваемость после кодирования. У LILAC нет накопления деградации, потому что повторное кодирование не меняет токены; у остальных кодеков даже малое начальное отличие постепенно превращается в сильный сдвиг.

Оригинальная статья на arXiv