BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling
BiMTokenizer показывает, что низкобитный речевой кодек не обязательно делить на отдельные акустическую и смысловую ветви. Одна двунаправленная сеть в пространстве состояний вместе с фиксированным решёточным квантователем сохраняет речь и признаки для последующих задач при 1,1 кбит/с.
Метод. Кодек выдаёт 12,5 кадров токенов в секунду и использует пять ступеней Residual Spherical Leech Quantization с фиксированным словарём на 196 560 позиций. Двунаправленные блоки Mamba видят левый и правый контекст, а смысловая дистилляция идёт от замороженного Whisper-small либо SenseVoice-small. Обучение занимает миллион шагов на 960 часах LibriSpeech и двух H100.
Результаты. Восстановление BiMTokenizer-Whisper на LibriSpeech test-clean даёт WER 2,44%, STOI 0,95, PESQ-NB/WB 3,56/3,03, UTMOS 4,21 и сходство говорящего 0,87. При близком битрейте DualCodec получает WER 2,46%, PESQ 3,25/2,71 и сходство 0,84, но содержит 664 против 253 млн параметров. Полный проход кодирования и декодирования требует 14,82 GMAC на секунду и RTF 0,007 на H100.
Ограничения. Большой фиксированный словарь может оказаться неудобным для авторегрессионного синтеза: редкие токены требуют больше данных. Модель всё ещё велика, обучена только на английском LibriSpeech и проверена преимущественно автоматическими показателями. Главное практическое ограничение — двунаправленность: кодек использует будущие кадры и пока годится только для обработки готовой записи.
Фишка из статьи. Контролируемое исключение компонентов показывает, что основной скачок разборчивости даёт именно сеть в пространстве состояний, а не только новый квантователь.
| Основа и квантователь | SIM | UTMOS | PESQ-NB/WB | WER |
|---|---|---|---|---|
| BiMamba + RSLQ | 0,88 | 4,12 | 3,56 / 2,99 | 2,55% |
| Самовнимание + RSLQ | 0,85 | 3,90 | 3,28 / 2,77 | 4,15% |
| BiMamba + GroupFSQ | 0,84 | 4,03 | 3,42 / 2,84 | 2,69% |
| BiMamba + RVQ | 0,84 | 4,00 | 3,42 / 2,75 | 2,75% |
Как это читать: все строки имеют один битрейт и не используют смысловую дистилляцию. Замена BiMamba на самовнимание повышает WER на 1,60 п.п., тогда как смена квантователя при сохранении BiMamba даёт гораздо меньшую потерю.