Geometric Iterative Retrieval for Neural Audio Codec Resynthesis
Авторы предлагают восстанавливать тонкие слои нейронного звукового кодека не как независимые номера кодов и не одной непрерывной регрессией, а последовательным поиском ближайших векторов в геометрии каждой кодовой книги. Идея использует собственную иерархию остаточного векторного квантования как ось уточнения вместо внешнего расписания диффузии. Самый интересный результат — расхождение между спектральными метриками и слушателями: дополнительные слои ухудшают численные оценки, но делают звук субъективно приятнее.
Метод. В DAC 44,1 кГц первый из девяти слоёв RVQ считается известным, а модель восстанавливает остальные восемь. DeBERTa-v3 с 12 слоями предсказывает непрерывный вектор очередной кодовой книги; симметричная контрастивная потеря приближает его к правильному вектору и отталкивает от других. Модуль внимания объединяет уже найденные слои без жёсткого предположения, что их достаточно просто сложить. При обучении все остаточные уровни считаются за один проход с причинной маской по оси кодовых книг, при выводе выполняются восемь последовательных шагов поиска ближайшего кода. DAC остаётся замороженным.
Результаты. На 1500 отрывках Common Voice, MTG-Jamendo и FMA метод получил лучшую среди обучаемых вариантов логарифмическую спектральную дистанцию LSD 10,61. Одношаговая косинусная регрессия лучше по SI-SDR и FAD: −0,22 дБ и 0,61 против −0,63 дБ и 0,94, так что объективной победы по всем критериям нет. Дискретное предсказание кодов заметно хуже — LSD 12,42, SI-SDR −6,93 дБ и FAD 2,46. В двойном слепом опыте 19 слушателей на девяти десятисекундных отрывках дали полному методу 54,0 балла из 100, одношаговой регрессии 43,4, а дискретному варианту лишь 9,1. Удаление послойной цели добавило 1,7 дБ LSD, замена внимания сложением — 1,13 дБ, замена контрастивной потери косинусной регрессией — 0,14 дБ.
Ограничения. На вход подаётся правильный первый слой DAC, поэтому не проверяется реальный сценарий, где грубые коды уже ошибочно сгенерированы. Использован один кодек, случайные проверочные части тех же трёх корпусов и всего девять отрывков в субъективной оценке. Все модели обучались 24 часа на четырёх RTX A6000, но задержка и коэффициент реального времени не приведены; восемь последовательных проходов могут быть существенны. Результат пока относится к восстановлению, а не к полному синтезу или улучшению речи.
Фишка из статьи. По всем трём объективным метрикам выгодно остановиться после третьего слоя, потому что каждый следующий остаток несёт всё меньше сигнала и примерно столько же ошибки предсказания. Слушатели выбирают противоположное: полный девятислойный звук получает более высокую оценку, поскольку, по наблюдению авторов, в нём меньше резкости и треска.
| Использовано слоёв | LSD, ниже лучше | SI-SDR, дБ | FAD, ниже лучше | Оценка слушателей |
|---|---|---|---|---|
| 1, только вход | 10,81 | −1,88 | 0,99 | 23,8 |
| 3 | 10,20 | −0,22 | 0,43 | 49,3 |
| 9 | 10,61 | −0,64 | 0,94 | 54,0 |
Как это читать: третий слой — явный максимум спектральной точности, но не воспринимаемого качества. Разница 4,7 балла в пользу девяти слоёв предупреждает, что LSD, SI-SDR и FAD плохо учитывают полезную слуховую роль тонких кодовых остатков; для генеративного звука ранняя остановка по метрике может быть ошибочной.