От просодии к тексту: восстановление текста по низкочастотной речи
Авторы ставят задачу в обратную привычной сторону: не предсказывают просодию по тексту, а проверяют, сколько текста можно восстановить по самым низким частотам речи. Whisper, получающий только 12 нижних mel-полос примерно до 450 Гц, неожиданно сохраняет значительную лексическую информацию.
Метод. Whisper дообучается на низкочастотных спектрограммах; отдельно Conformer реконструирует те же 12 полос только из F0 и энергии, чтобы отделить собственно просодические признаки от другой низкочастотной структуры. Оценка проводится на 3000 фрагментах Yodas и 1000 более поздних фрагментах AnimeVox.
Результаты. Низкочастотный Whisper получает WER 36,7% на Yodas и 60,0% на AnimeVox; 10/5% реплик восстановлены без единой ошибки, а правильный следующий токен при известном префиксе находится на первом месте в 78,8/66,8% случаев. Чисто просодический двухэтапный вариант заметно слабее: WER 68,9/82,4%.
Ограничения. Низкие mel-полосы содержат не только F0 и энергию, поэтому заголовочная интерпретация «просодия в текст» шире доказанного. Yodas мог пересекаться с закрытыми данными Whisper, а AnimeVox сильно отличается по жанру. Базовая модель без адаптации почти не работает, что подчёркивает зависимость от дообучения.
Фишка из статьи. Главный отрицательный результат: явные F0 и энергия объясняют лишь часть эффекта. Между низкочастотным и просодическим вариантами остаётся разрыв 22–32 п.п. WER, значит, в диапазоне до 450 Гц скрыта дополнительная фонетическая структура.
| Вход модели | Yodas WER, % | AnimeVox WER, % | Top-1 следующего токена, % |
|---|---|---|---|
| 12 нижних mel-полос | 36,7 | 60,0 | 78,8 / 66,8 |
| Реконструкция из F0 и энергии | 68,9 | 82,4 | 64,9 / 58,5 |
| Исходный Whisper без адаптации | 100,1 | 113,8 | 44,5 / 34,2 |
Как это читать: правильный токен часто имеет высокий ранг даже при плохой полной расшифровке. Это признак сильной локальной подсказки, но не доказательство, что по просодии можно надёжно восстановить содержание целой фразы.