Q-SPT: обучаемое запросное сжатие для низкочастотной токенизации речи
Q-SPT сжимает речь до 6,25 кадра в секунду, но не заставляет смысловой и акустический потоки делить одинаковые временные границы. Обучаемые запросы отдельно собирают контекст для текста и для звучания, а дополнительная авторегрессионная потеря напрямую защищает разборчивость смысловых токенов.
Метод. Замороженный SenseVoice-Small извлекает смысловые признаки, кодировщик DAC — акустические. Два независимых компрессора с перекрёстным вниманием сводят их к фиксированной частоте; смысл кодируется FSQ, остаток — семью книгами RVQ. При обучении модель также восстанавливает признаки и предсказывает расшифровку, но эти головы при выводе не нужны.
Результаты. На LibriSpeech test-clean полнопоточная реконструкция Q-SPT даёт WER 2,52%, PESQ-WB 2,26 и UTMOS 4,07 при 0,619 кбит/с. В речевой языковой модели WER распознавания равен 5,88%; синтез получает WER 11,82%, UTMOS 3,44 и DNSMOS 3,28. Это лучше FlexiCodec по воспринимаемому качеству, хотя FlexiCodec синтезирует текст разборчивее: WER 10,65%.
Ограничения. Кодек обучается на 47,7 тыс. часов английской речи и оценивается только на LibriSpeech. Для каждого токенизатора отдельно полностью настраивается Qwen3.5-4B, поэтому вычислительная стоимость велика. Субъективного прослушивания нет, а UTMOS и DNSMOS могут не отражать артефакты низкой кадровой частоты.
Фишка из статьи. Раздельные временные границы оказываются не косметикой. Если при выводе навязать акустическому потоку границы смыслового, WER полной реконструкции растёт с 2,52% до 3,83%; если убрать текстовую потерю, WER распознавания языковой модели растёт с 5,88% до 7,04%.
| Вариант | WER смыслового потока | WER всех потоков | PESQ-WB | UTMOS |
|---|---|---|---|---|
| Общие веса компрессоров | 6,16% | 2,86% | 2,16 | 4,02 |
| Общие временные границы | 4,29% | 3,83% | 2,14 | 3,99 |
| Раздельные компрессоры без текстовой потери | 4,97% | 2,59% | 2,25 | 4,03 |
| Полный Q-SPT | 4,29% | 2,52% | 2,26 | 4,07 |
Как это читать: смысл и акустика действительно требуют разных способов агрегирования. Текстовая цель укрепляет первый поток, а отдельные границы сохраняют детали остаточных акустических кодов; одно общее правило ухудшает обе стороны.