Нейронные кодеки Остаточное квантование Восстановление звука
arXiv cs.SD

Geometric Iterative Retrieval for Neural Audio Codec Resynthesis

arXiv:2608.19141

Авторы предлагают восстанавливать тонкие слои нейронного звукового кодека не как независимые номера кодов и не одной непрерывной регрессией, а последовательным поиском ближайших векторов в геометрии каждой кодовой книги. Идея использует собственную иерархию остаточного векторного квантования как ось уточнения вместо внешнего расписания диффузии. Самый интересный результат — расхождение между спектральными метриками и слушателями: дополнительные слои ухудшают численные оценки, но делают звук субъективно приятнее.

Метод. В DAC 44,1 кГц первый из девяти слоёв RVQ считается известным, а модель восстанавливает остальные восемь. DeBERTa-v3 с 12 слоями предсказывает непрерывный вектор очередной кодовой книги; симметричная контрастивная потеря приближает его к правильному вектору и отталкивает от других. Модуль внимания объединяет уже найденные слои без жёсткого предположения, что их достаточно просто сложить. При обучении все остаточные уровни считаются за один проход с причинной маской по оси кодовых книг, при выводе выполняются восемь последовательных шагов поиска ближайшего кода. DAC остаётся замороженным.

Результаты. На 1500 отрывках Common Voice, MTG-Jamendo и FMA метод получил лучшую среди обучаемых вариантов логарифмическую спектральную дистанцию LSD 10,61. Одношаговая косинусная регрессия лучше по SI-SDR и FAD: −0,22 дБ и 0,61 против −0,63 дБ и 0,94, так что объективной победы по всем критериям нет. Дискретное предсказание кодов заметно хуже — LSD 12,42, SI-SDR −6,93 дБ и FAD 2,46. В двойном слепом опыте 19 слушателей на девяти десятисекундных отрывках дали полному методу 54,0 балла из 100, одношаговой регрессии 43,4, а дискретному варианту лишь 9,1. Удаление послойной цели добавило 1,7 дБ LSD, замена внимания сложением — 1,13 дБ, замена контрастивной потери косинусной регрессией — 0,14 дБ.

Ограничения. На вход подаётся правильный первый слой DAC, поэтому не проверяется реальный сценарий, где грубые коды уже ошибочно сгенерированы. Использован один кодек, случайные проверочные части тех же трёх корпусов и всего девять отрывков в субъективной оценке. Все модели обучались 24 часа на четырёх RTX A6000, но задержка и коэффициент реального времени не приведены; восемь последовательных проходов могут быть существенны. Результат пока относится к восстановлению, а не к полному синтезу или улучшению речи.

Фишка из статьи. По всем трём объективным метрикам выгодно остановиться после третьего слоя, потому что каждый следующий остаток несёт всё меньше сигнала и примерно столько же ошибки предсказания. Слушатели выбирают противоположное: полный девятислойный звук получает более высокую оценку, поскольку, по наблюдению авторов, в нём меньше резкости и треска.

Использовано слоёвLSD, ниже лучшеSI-SDR, дБFAD, ниже лучшеОценка слушателей
1, только вход10,81−1,880,9923,8
310,20−0,220,4349,3
910,61−0,640,9454,0

Как это читать: третий слой — явный максимум спектральной точности, но не воспринимаемого качества. Разница 4,7 балла в пользу девяти слоёв предупреждает, что LSD, SI-SDR и FAD плохо учитывают полезную слуховую роль тонких кодовых остатков; для генеративного звука ранняя остановка по метрике может быть ошибочной.

Оригинальная статья на arXiv