токенизация речи звуковые кодеки речевые языковые модели
arXiv cs.SD

Q-SPT: обучаемое запросное сжатие для низкочастотной токенизации речи

arXiv:2610.01492

Q-SPT сжимает речь до 6,25 кадра в секунду, но не заставляет смысловой и акустический потоки делить одинаковые временные границы. Обучаемые запросы отдельно собирают контекст для текста и для звучания, а дополнительная авторегрессионная потеря напрямую защищает разборчивость смысловых токенов.

Метод. Замороженный SenseVoice-Small извлекает смысловые признаки, кодировщик DAC — акустические. Два независимых компрессора с перекрёстным вниманием сводят их к фиксированной частоте; смысл кодируется FSQ, остаток — семью книгами RVQ. При обучении модель также восстанавливает признаки и предсказывает расшифровку, но эти головы при выводе не нужны.

Результаты. На LibriSpeech test-clean полнопоточная реконструкция Q-SPT даёт WER 2,52%, PESQ-WB 2,26 и UTMOS 4,07 при 0,619 кбит/с. В речевой языковой модели WER распознавания равен 5,88%; синтез получает WER 11,82%, UTMOS 3,44 и DNSMOS 3,28. Это лучше FlexiCodec по воспринимаемому качеству, хотя FlexiCodec синтезирует текст разборчивее: WER 10,65%.

Ограничения. Кодек обучается на 47,7 тыс. часов английской речи и оценивается только на LibriSpeech. Для каждого токенизатора отдельно полностью настраивается Qwen3.5-4B, поэтому вычислительная стоимость велика. Субъективного прослушивания нет, а UTMOS и DNSMOS могут не отражать артефакты низкой кадровой частоты.

Фишка из статьи. Раздельные временные границы оказываются не косметикой. Если при выводе навязать акустическому потоку границы смыслового, WER полной реконструкции растёт с 2,52% до 3,83%; если убрать текстовую потерю, WER распознавания языковой модели растёт с 5,88% до 7,04%.

ВариантWER смыслового потокаWER всех потоковPESQ-WBUTMOS
Общие веса компрессоров6,16%2,86%2,164,02
Общие временные границы4,29%3,83%2,143,99
Раздельные компрессоры без текстовой потери4,97%2,59%2,254,03
Полный Q-SPT4,29%2,52%2,264,07

Как это читать: смысл и акустика действительно требуют разных способов агрегирования. Текстовая цель укрепляет первый поток, а отдельные границы сохраняют детали остаточных акустических кодов; одно общее правило ухудшает обе стороны.

Оригинальная статья на arXiv