Audiobook narration appeal: акустика голоса предсказывает вовлечение слушателей
Эта работа интересна не как очередная emotion/voice-quality classifier paper, а как попытка связать акустику narration с реальным consumption signal для аудиокниг. Авторы берут LibriVox, извлекают интерпретируемые vocal/acoustic features и проверяют, остается ли связь с appeal после учета жанра, title effects и разных записей одной и той же книги.
Метод. Для каждой аудиокниги строится 129-dimensional vector: eGeMAPSv02 признаки вроде F0, jitter, shimmer, HNR, formants, MFCC и spectral flux; YAMNet audio event scores; Whisper-tiny transcripts с word/syllable rate. Для статистики признаки чистятся через VIF pruning до 70, затем используются GLM, genre-specific GLM и Linear Mixed-Effects model с random intercept по book-group. Для prediction авторы делают quartile classification view-rate и ranking внутри групп одинаковых titles.
Результаты. Global GLM дает pseudo-R² 0.09: это немного в абсолюте, но заметно для шумного real-world proxy, где не учтены продвижение, известность книги и поведение платформы. Найден 31 significant acoustic feature, при этом effect sizes в основном малы: |β| ≤ 0.13. Внутри одного title variation appeal между разными narrations равна 0.52, почти как variation между разными titles 0.54; LME улучшает fit относительно global GLM на AIC_GLM − AIC_LME = 210. В классификации combined genre+audio model достигает accuracy 0.35 против random 0.25, а ranking на proprietary return-rate subset дает Kendall τ до 0.28.
Ограничения. View-rate LibriVox — грубый proxy appeal: он зависит от длины, популярности, внешнего трафика и качества страницы. Данные volunteer-narration неоднородны по записи и production quality. Эффекты небольшие, а часть proprietary validation не полностью воспроизводима снаружи, поэтому результаты лучше читать как evidence for signal, а не как готовый casting algorithm.
Фишка из статьи. Самый полезный результат — сравнение слабого, но устойчивого audio signal в classification и ranking. Одни акустические признаки уже лучше random, а их комбинация с жанром дает лучший quartile classifier.
| Модель / данные | Метрика | Результат | Интерпретация |
|---|---|---|---|
| Random baseline | quartile accuracy | 0.25 [0.24, 0.26] | четыре класса appeal |
| LR, audio features | quartile accuracy | 0.32 [0.32, 0.33] | акустика одна дает сигнал |
| LR, genre+audio | quartile accuracy | 0.35 [0.34, 0.35] | лучший classifier |
| LGBM Lambda, full view-rate | Kendall τ | 0.13 [0.03, 0.23] | слабый, но значимый ranking |
| LGBM Lambda, return-rate subset | Kendall τ | 0.28 [0.13, 0.42] | лучше с более прямым engagement metric |
Как это читать: статья не доказывает, что можно “вычислить идеального диктора” по MFCC и pitch. Она показывает более скромную и практичную вещь: acoustic narration features дают статистически устойчивый сигнал, особенно когда сравниваются разные исполнения одного и того же title.