Wavelets Tokenizer Haar DWT
Wavelet tokenization

Wavelet as Tokenizer: общий Haar DWT schema для audio, images и video

Audio PSNR 39.92 dB

Wavelet as Tokenizer — предварительная, но очень симпатичная попытка вернуть классическую multiresolution-структуру в разговор о neural tokenizers. Вместо отдельных latent grids для audio, images и video автор строит общий continuous-token schema вокруг one-level Haar DWT/IDWT: коэффициенты wavelet-разложения превращаются в токены, обрабатываются shared trunk-ом и собираются обратно в сигнал.

Как устроена схема

Для входа ранга d используется separable Haar transform. Audio получает 2 subbands, images — 4, video — 8. Каждый token хранит coefficient value, а опционально еще metadata: modality, rank, scale, subband и position. После shared encoder-decoder trunk токены scatter-ятся обратно в coefficient tensor, а реконструкция идет через modality-specific Haar IDWT.

Важно, что автор честно не заявляет “универсальный дискретный словарь для всех сигналов”. Пока это continuous-token autoencoder и rate proxy через token count/latent dimension, без entropy coding и битрейта. Но как probe идеи он полезен.

Результаты

На Speech Commands, EuroSAT RGB и DAVIS 2017 shared schema с audio scale 4 достигает 39.92 dB audio PSNR, 29.37 dB image PSNR и 23.93 dB video PSNR. Separate baseline лучше на audio — 40.79 dB, но слабее на images/video в этой маленькой постановке: 22.91 и 20.91 dB.

Matched-rate sweep показывает неожиданную деталь: metadata не всегда помогает. Shared full metadata дает 39.92 / 29.37 / 23.93 dB для audio/image/video, а shared no metadata — 41.29 / 30.41 / 29.42 dB. То есть “добавим структурные embeddings” не является бесплатным выигрышем для всех модальностей.

Самая DSP-приятная часть — fixed-rate energy selection. Простой global energy top-k по wavelet coefficients улучшает average PSNR относительно uniform selection на 16.73 dB для audio, 16.90 dB для images и 15.86 dB для video across keep ratios. Это сильный аргумент, что энергия wavelet coefficients уже является неплохим non-parametric signal importance score.

Практический вывод

Статья пока скорее research note, чем готовый codec. Но идея важная: tokenization можно строить не только вокруг VQ/RVQ и learned latent grids, а вокруг обратимых signal transforms с явной multiresolution геометрией. Для аудио это особенно интересно как мост между wavelet/DSP intuition и современными audio LLM/tokenizer pipelines.

Фишка из статьи. “Wavelet as Tokenizer” фактически предлагает не универсальный discrete vocabulary, а unified sparse continuous token interface для аудио, изображений и видео. Самый неожиданный результат: metadata не всегда помогает; при matched token rate вариант без metadata лучше на visual modalities.

Dense settingAudio PSNRImage PSNRVideo PSNRКомментарий
Separate baseline40.7922.9120.91отдельная схема под модальность
Shared schema, scale 439.9229.3723.93аудио почти равно, image/video сильно выше
Разница shared - separate-0.87+6.46+3.03цена унификации мала для audio
Matched-rate settingAudio PSNRImage PSNRVideo PSNR
Separate matched43.9322.4721.76
Shared, full metadata39.9229.3723.93
Shared, no metadata41.2930.4129.42

Energy-based sparse selection дает большой выигрыш против uniform/random: средний gain около +16.73 dB для audio, +16.90 dB для image и +15.86 dB для video. Но авторы честно фиксируют ограничения: токены continuous, нет дискретного vocabulary и downstream LM, а эксперименты низкоразрешающие и MSE-ориентированные.

Оригинальная статья на arXiv