SEER: усиление эмоциональных признаков речи для кохлеарных имплантов с учётом исходного сигнала
Кохлеарный имплант сохраняет разборчивость, но ослабляет признаки эмоции. SEER подбирает для каждой исходной реплики не просто «сильный» эталон той же эмоции, а запись, чья конверсия лучше переживает конкретную модель обработки импланта.
Метод. Ретривер оценивает полезность пары «исходная речь — эталон» по результату эмоциональной конверсии после PSHC-вокодера. Неопределённостное исследование выбирает информативные пары без полного перебора; параллельные записи и метки силы эмоции не требуются.
Результаты. При N8 macro-F1 растёт относительно исходной речи на 7,30 п.п. в RAVDESS и 11,66 п.п. в ESD. На слушательском тесте из 16 человек SEER улучшает F1 на 21,94/17,48/8,68 п.п. для N4/N8/N16. По сравнению с фиксированным эталоном одновременно снижается WER.
Ограничения. Всего три эмоции, 24 актёра RAVDESS и десять говорящих ESD; обучение оптимизировано под симулятор N8, а реальные пользователи имплантов не участвовали. На самом разреженном N4 объективный выигрыш RAVDESS незначим.
Фишка из статьи. Успех почти не зависит от совпадения пола или текста эталона. Сильная экспрессия полезна в среднем, но тоже не даёт надёжного правила для каждой реплики, что и оправдывает условный ретривер.
| Фактор эталона | Группы | N4, % | N8, % | N16, % |
|---|---|---|---|---|
| Интенсивность | обычная / сильная | 56,0 / 65,1 | 59,4 / 63,1 | 64,5 / 75,1 |
| Пол | разный / одинаковый | 60,7 / 62,8 | 61,7 / 62,8 | 70,6 / 71,3 |
| Текст | разный / одинаковый | 62,0 / 60,9 | 61,7 / 61,9 | 69,6 / 71,4 |
Как это читать: совпадение демографии и содержания даёт максимум 2,1 п.п. и статистически незначимо. Даже заметный средний эффект силы эмоции значим только для N4, поэтому статическое правило выбора эталона недостаточно.