Speaker recognition Multimodal LLM
Speaker recognition

DramaSR-LRM: reasoning LLM для speaker recognition в long-form TV dramas

Acc 87.79%

Статья занимается speaker recognition в длинных ТВ-драмах: нужно назначить каждому subtitle utterance персонажа, когда в кадре много людей, голоса короткие, а акустика и монтаж мешают простому voiceprint matching. Интерес здесь в том, что авторы не заменяют акустический baseline end-to-end моделью, а добавляют reasoning LLM, который вызывает инструменты для voice similarity, визуального контекста и отношений между персонажами. Получается гибридная система для long-form speaker attribution, где речь используется вместе с видео и сценарным контекстом.

Метод. Базовая разметка строится label propagation pipeline: OCR/subtitles, cast information, face recognition, pseudo-labels и ERes2Net voice embeddings дают начальные speaker labels. DramaSR-LRM затем получает контекст диалога и может вызывать три инструмента: voice_sim для cosine similarity между utterance voiceprint и character embeddings, video_cap для hierarchical video captions, и char_relation для социальных связей и реплик-обращений. Backbone — Qwen3-8B, обученный SFT и RL; teacher data для SFT генерируется Gemini-3-Pro на одном drama subset.

Результаты. На DramaSR-532K benchmark из 13 TV series, 806 videos и 525.5 часов видео средняя accuracy baseline label propagation составляет 85.49%, а DramaSR-LRM — 87.79%, то есть +2.30 пункта и около 16% relative error reduction. На коротких utterances выигрыш больше: для short subset accuracy растет с 82.37% до 85.70%, а для very-short — с 67.45% до 76.65%. На off-screen utterances, где лицо говорящего не попадает в 30-секундное окно, success rate поднимается с 13.4% у LP baseline до 52.4%.

Ограничения. Это не чистая audio-only speaker recognition система: ей нужны субтитры, визуальные captions, список персонажей и крупные мультимодальные/LLM компоненты. Часть данных для обучения получена через proprietary teacher model, а основной backbone и video captioner велики для дешевого production inference. Домен тоже специфический: scripted TV dramas с персонажами и сюжетными связями, поэтому перенос на meetings, call-center или diarization без known cast не гарантирован.

Фишка из статьи. Самая показательная часть — tool ablation. Без voice_sim система падает ниже исходного label propagation baseline, но video_cap и char_relation особенно помогают там, где голосовой фрагмент слишком короткий и акустический embedding нестабилен.

МетодAllLongMediumShortVery short
Label Prop85.49%85.34%87.12%82.37%67.45%
DramaSR-LRM без voice_sim72.61%72.48%73.21%70.32%62.91%
DramaSR-LRM без video_cap86.76%86.45%87.81%83.30%72.33%
DramaSR-LRM без char_relation87.55%87.41%88.68%85.33%75.66%
Full Set87.79%87.62%88.92%85.70%76.65%

Как это читать: акустический инструмент остается несущей опорой — без него модель теряет 15.18 пункта accuracy относительно full set. Но прирост на very-short utterances показывает, зачем нужен reasoning layer: он компенсирует акустическую разреженность через визуальное действие, обращения вроде “Dad/Mom” и отношения персонажей.

Оригинальная статья на arXiv