DramaSR-LRM: reasoning LLM для speaker recognition в long-form TV dramas
Статья занимается speaker recognition в длинных ТВ-драмах: нужно назначить каждому subtitle utterance персонажа, когда в кадре много людей, голоса короткие, а акустика и монтаж мешают простому voiceprint matching. Интерес здесь в том, что авторы не заменяют акустический baseline end-to-end моделью, а добавляют reasoning LLM, который вызывает инструменты для voice similarity, визуального контекста и отношений между персонажами. Получается гибридная система для long-form speaker attribution, где речь используется вместе с видео и сценарным контекстом.
Метод. Базовая разметка строится label propagation pipeline: OCR/subtitles, cast information, face recognition, pseudo-labels и ERes2Net voice embeddings дают начальные speaker labels. DramaSR-LRM затем получает контекст диалога и может вызывать три инструмента: voice_sim для cosine similarity между utterance voiceprint и character embeddings, video_cap для hierarchical video captions, и char_relation для социальных связей и реплик-обращений. Backbone — Qwen3-8B, обученный SFT и RL; teacher data для SFT генерируется Gemini-3-Pro на одном drama subset.
Результаты. На DramaSR-532K benchmark из 13 TV series, 806 videos и 525.5 часов видео средняя accuracy baseline label propagation составляет 85.49%, а DramaSR-LRM — 87.79%, то есть +2.30 пункта и около 16% relative error reduction. На коротких utterances выигрыш больше: для short subset accuracy растет с 82.37% до 85.70%, а для very-short — с 67.45% до 76.65%. На off-screen utterances, где лицо говорящего не попадает в 30-секундное окно, success rate поднимается с 13.4% у LP baseline до 52.4%.
Ограничения. Это не чистая audio-only speaker recognition система: ей нужны субтитры, визуальные captions, список персонажей и крупные мультимодальные/LLM компоненты. Часть данных для обучения получена через proprietary teacher model, а основной backbone и video captioner велики для дешевого production inference. Домен тоже специфический: scripted TV dramas с персонажами и сюжетными связями, поэтому перенос на meetings, call-center или diarization без known cast не гарантирован.
Фишка из статьи. Самая показательная часть — tool ablation. Без voice_sim система падает ниже исходного label propagation baseline, но video_cap и char_relation особенно помогают там, где голосовой фрагмент слишком короткий и акустический embedding нестабилен.
| Метод | All | Long | Medium | Short | Very short |
|---|---|---|---|---|---|
| Label Prop | 85.49% | 85.34% | 87.12% | 82.37% | 67.45% |
| DramaSR-LRM без voice_sim | 72.61% | 72.48% | 73.21% | 70.32% | 62.91% |
| DramaSR-LRM без video_cap | 86.76% | 86.45% | 87.81% | 83.30% | 72.33% |
| DramaSR-LRM без char_relation | 87.55% | 87.41% | 88.68% | 85.33% | 75.66% |
| Full Set | 87.79% | 87.62% | 88.92% | 85.70% | 76.65% |
Как это читать: акустический инструмент остается несущей опорой — без него модель теряет 15.18 пункта accuracy относительно full set. Но прирост на very-short utterances показывает, зачем нужен reasoning layer: он компенсирует акустическую разреженность через визуальное действие, обращения вроде “Dad/Mom” и отношения персонажей.