речевые кодеки звуковые токены сегментация речи
arXiv cs.SD

Интерпретация и оценка границ в речевых кодеках с переменной скоростью

arXiv:2609.36951

В кодеке с переменной частотой токенов граница решает, какие кадры будут объединены, поэтому её смысл влияет и на интерпретируемость, и на восстановление речи. Работа сравнивает семь способов расстановки границ с фонемами, слогами, словами и акустическими событиями при одинаковой средней скорости.

Метод. Границы извлекаются из признаков разных слоёв Whisper, SenseVoice и самоконтролируемых кодировщиков, затем один декодер дообучается на фиксированных сегментациях. Качество измеряется WER реконструкции, спектральной ошибкой, PESQ, сходством говорящего и временем выбора границ.

Результаты. CodecSlime даёт лучший WER 5,394% при 6,25 Гц, но тратит 19,546 мс на динамический поиск. PLE почти совпадает по WER, 5,415%, за 0,283 мс. Ранги качества при одном и восьми уровнях квантования коррелируют на 0,964.

Ограничения. Проверяется только английский TIMIT и четыре семейства признаков. Субъективного прослушивания и потоковой реализации нет; корреляция смысловых границ с качеством не доказывает причинность.

Фишка из статьи. Естественная фонемная граница оказалась хуже равномерной сетки, тогда как слоговая лучше. Фонемы не всегда совпадают с местом, где кодеку нужен новый токен из-за коартикуляции; смысловая интерпретируемость сама по себе не гарантирует полезную сегментацию.

СегментацияWER при частоте фонем 8,06 Гц ↓WER при частоте слогов 4,47 Гц ↓
Равномерная6,47%17,61%
По эталонным фонемам/слогам7,10%13,85%
CodecSlime5,11%11,28%
По сходству признаков5,05%14,99%

Как это читать: слог полезен как предварительное правило распределения токенов, но адаптивный поиск всё равно лучше. Фонемная разметка, несмотря на точность лингвистического выравнивания, может разрезать непрерывную акустическую динамику в неудачном месте.

Оригинальная статья на arXiv