Интерпретация и оценка границ в речевых кодеках с переменной скоростью
В кодеке с переменной частотой токенов граница решает, какие кадры будут объединены, поэтому её смысл влияет и на интерпретируемость, и на восстановление речи. Работа сравнивает семь способов расстановки границ с фонемами, слогами, словами и акустическими событиями при одинаковой средней скорости.
Метод. Границы извлекаются из признаков разных слоёв Whisper, SenseVoice и самоконтролируемых кодировщиков, затем один декодер дообучается на фиксированных сегментациях. Качество измеряется WER реконструкции, спектральной ошибкой, PESQ, сходством говорящего и временем выбора границ.
Результаты. CodecSlime даёт лучший WER 5,394% при 6,25 Гц, но тратит 19,546 мс на динамический поиск. PLE почти совпадает по WER, 5,415%, за 0,283 мс. Ранги качества при одном и восьми уровнях квантования коррелируют на 0,964.
Ограничения. Проверяется только английский TIMIT и четыре семейства признаков. Субъективного прослушивания и потоковой реализации нет; корреляция смысловых границ с качеством не доказывает причинность.
Фишка из статьи. Естественная фонемная граница оказалась хуже равномерной сетки, тогда как слоговая лучше. Фонемы не всегда совпадают с местом, где кодеку нужен новый токен из-за коартикуляции; смысловая интерпретируемость сама по себе не гарантирует полезную сегментацию.
| Сегментация | WER при частоте фонем 8,06 Гц ↓ | WER при частоте слогов 4,47 Гц ↓ |
|---|---|---|
| Равномерная | 6,47% | 17,61% |
| По эталонным фонемам/слогам | 7,10% | 13,85% |
| CodecSlime | 5,11% | 11,28% |
| По сходству признаков | 5,05% | 14,99% |
Как это читать: слог полезен как предварительное правило распределения токенов, но адаптивный поиск всё равно лучше. Фонемная разметка, несмотря на точность лингвистического выравнивания, может разрезать непрерывную акустическую динамику в неудачном месте.