идентификация говорящего речевые языковые модели длинный диалог
arXiv eess.AS

Голос как идентификатор: рассуждение о личности говорящего с замороженной текстовой языковой моделью

arXiv:2609.38501

Авторы проверяют, можно ли научить замороженную текстовую языковую модель рассуждать о людях по голосу, не превращая её в полноценную звуковую модель. Небольшой проектор переводит эмбеддинг говорящего в четыре мягких токена, которые становятся устойчивым «идентификатором» участника на протяжении длинного разговора.

Метод. Замороженный VoxBlink2 извлекает голосовой эмбеддинг, проектор на 8,5 млн параметров подаёт его в замороженную Qwen3.5-9B. Обучение разделено на распознавание голоса, связывание его с фактами и временное рассуждение. В SpeakerBind 149 шаблонов, 6000 вопросов и истории длиной 138–187 реплик; открытые ответы оценивает GPT-5.6-terra.

Результаты. На VoxCeleb1 точность идентификации остаётся около 97,4–98,36%. На SpeakerBind полный метод получает 70,40% против 71,88% у системы с явными текстовыми метками и 24,21% у варианта только с транскриптом. Если случайно переназначить голосовые связи, результат падает до 2,95%, то есть модель действительно использует голосовой ключ.

Ограничения. Диалоги синтетические и контролируемые, ошибки распознавания речи не являются центральной трудностью. Оценка открытых ответов зависит от другой языковой модели, проверен один основной текстовый каркас. Практическое использование требует отдельного анализа согласия, приватности и хранения голосовых отпечатков.

Фишка из статьи. Обучение всех навыков сразу почти разрушает связывание фактов, хотя распознавание говорящего остаётся высоким. Значит, хорошо разделимые голосовые эмбеддинги ещё не образуют рабочую память: проектору нужно последовательно освоить идентичность, привязку и временные отношения.

Схема обученияVoxCeleb-H ↑Агрегация фактов ↑Временное рассуждение ↑
Только этап 193,14%47,2%73,58%
Этапы 1 + 297,24%52,4%75,15%
Все задачи сразу91,09%7,0%40,85%
Полная поэтапная схема97,40%52,6%80,0%

Как это читать: провал совместного обучения не объясняется одной лишь слабой верификацией — 91,09% на VoxCeleb-H всё ещё высоки, но способность использовать голос как адрес памяти почти исчезает.

Оригинальная статья на arXiv