Wavelet as Tokenizer: общий Haar DWT schema для audio, images и video
Wavelet as Tokenizer — предварительная, но очень симпатичная попытка вернуть классическую multiresolution-структуру в разговор о neural tokenizers. Вместо отдельных latent grids для audio, images и video автор строит общий continuous-token schema вокруг one-level Haar DWT/IDWT: коэффициенты wavelet-разложения превращаются в токены, обрабатываются shared trunk-ом и собираются обратно в сигнал.
Как устроена схема
Для входа ранга d используется separable Haar transform. Audio получает 2 subbands, images — 4, video — 8. Каждый token хранит coefficient value, а опционально еще metadata: modality, rank, scale, subband и position. После shared encoder-decoder trunk токены scatter-ятся обратно в coefficient tensor, а реконструкция идет через modality-specific Haar IDWT.
Важно, что автор честно не заявляет “универсальный дискретный словарь для всех сигналов”. Пока это continuous-token autoencoder и rate proxy через token count/latent dimension, без entropy coding и битрейта. Но как probe идеи он полезен.
Результаты
На Speech Commands, EuroSAT RGB и DAVIS 2017 shared schema с audio scale 4 достигает 39.92 dB audio PSNR, 29.37 dB image PSNR и 23.93 dB video PSNR. Separate baseline лучше на audio — 40.79 dB, но слабее на images/video в этой маленькой постановке: 22.91 и 20.91 dB.
Matched-rate sweep показывает неожиданную деталь: metadata не всегда помогает. Shared full metadata дает 39.92 / 29.37 / 23.93 dB для audio/image/video, а shared no metadata — 41.29 / 30.41 / 29.42 dB. То есть “добавим структурные embeddings” не является бесплатным выигрышем для всех модальностей.
Самая DSP-приятная часть — fixed-rate energy selection. Простой global energy top-k по wavelet coefficients улучшает average PSNR относительно uniform selection на 16.73 dB для audio, 16.90 dB для images и 15.86 dB для video across keep ratios. Это сильный аргумент, что энергия wavelet coefficients уже является неплохим non-parametric signal importance score.
Практический вывод
Статья пока скорее research note, чем готовый codec. Но идея важная: tokenization можно строить не только вокруг VQ/RVQ и learned latent grids, а вокруг обратимых signal transforms с явной multiresolution геометрией. Для аудио это особенно интересно как мост между wavelet/DSP intuition и современными audio LLM/tokenizer pipelines.
Фишка из статьи. “Wavelet as Tokenizer” фактически предлагает не универсальный discrete vocabulary, а unified sparse continuous token interface для аудио, изображений и видео. Самый неожиданный результат: metadata не всегда помогает; при matched token rate вариант без metadata лучше на visual modalities.
| Dense setting | Audio PSNR | Image PSNR | Video PSNR | Комментарий |
|---|---|---|---|---|
| Separate baseline | 40.79 | 22.91 | 20.91 | отдельная схема под модальность |
| Shared schema, scale 4 | 39.92 | 29.37 | 23.93 | аудио почти равно, image/video сильно выше |
| Разница shared - separate | -0.87 | +6.46 | +3.03 | цена унификации мала для audio |
| Matched-rate setting | Audio PSNR | Image PSNR | Video PSNR |
|---|---|---|---|
| Separate matched | 43.93 | 22.47 | 21.76 |
| Shared, full metadata | 39.92 | 29.37 | 23.93 |
| Shared, no metadata | 41.29 | 30.41 | 29.42 |
Energy-based sparse selection дает большой выигрыш против uniform/random: средний gain около +16.73 dB для audio, +16.90 dB для image и +15.86 dB для video. Но авторы честно фиксируют ограничения: токены continuous, нет дискретного vocabulary и downstream LM, а эксперименты низкоразрешающие и MSE-ориентированные.