Audiobooks Paralinguistics Ranking
Paralinguistics

Audiobook narration appeal: акустика голоса предсказывает вовлечение слушателей

Acc 0.35

Эта работа интересна не как очередная emotion/voice-quality classifier paper, а как попытка связать акустику narration с реальным consumption signal для аудиокниг. Авторы берут LibriVox, извлекают интерпретируемые vocal/acoustic features и проверяют, остается ли связь с appeal после учета жанра, title effects и разных записей одной и той же книги.

Метод. Для каждой аудиокниги строится 129-dimensional vector: eGeMAPSv02 признаки вроде F0, jitter, shimmer, HNR, formants, MFCC и spectral flux; YAMNet audio event scores; Whisper-tiny transcripts с word/syllable rate. Для статистики признаки чистятся через VIF pruning до 70, затем используются GLM, genre-specific GLM и Linear Mixed-Effects model с random intercept по book-group. Для prediction авторы делают quartile classification view-rate и ranking внутри групп одинаковых titles.

Результаты. Global GLM дает pseudo-R² 0.09: это немного в абсолюте, но заметно для шумного real-world proxy, где не учтены продвижение, известность книги и поведение платформы. Найден 31 significant acoustic feature, при этом effect sizes в основном малы: |β| ≤ 0.13. Внутри одного title variation appeal между разными narrations равна 0.52, почти как variation между разными titles 0.54; LME улучшает fit относительно global GLM на AIC_GLM − AIC_LME = 210. В классификации combined genre+audio model достигает accuracy 0.35 против random 0.25, а ranking на proprietary return-rate subset дает Kendall τ до 0.28.

Ограничения. View-rate LibriVox — грубый proxy appeal: он зависит от длины, популярности, внешнего трафика и качества страницы. Данные volunteer-narration неоднородны по записи и production quality. Эффекты небольшие, а часть proprietary validation не полностью воспроизводима снаружи, поэтому результаты лучше читать как evidence for signal, а не как готовый casting algorithm.

Фишка из статьи. Самый полезный результат — сравнение слабого, но устойчивого audio signal в classification и ranking. Одни акустические признаки уже лучше random, а их комбинация с жанром дает лучший quartile classifier.

Модель / данныеМетрикаРезультатИнтерпретация
Random baselinequartile accuracy0.25 [0.24, 0.26]четыре класса appeal
LR, audio featuresquartile accuracy0.32 [0.32, 0.33]акустика одна дает сигнал
LR, genre+audioquartile accuracy0.35 [0.34, 0.35]лучший classifier
LGBM Lambda, full view-rateKendall τ0.13 [0.03, 0.23]слабый, но значимый ranking
LGBM Lambda, return-rate subsetKendall τ0.28 [0.13, 0.42]лучше с более прямым engagement metric

Как это читать: статья не доказывает, что можно “вычислить идеального диктора” по MFCC и pitch. Она показывает более скромную и практичную вещь: acoustic narration features дают статистически устойчивый сигнал, особенно когда сравниваются разные исполнения одного и того же title.

Оригинальная статья на arXiv