Голос как идентификатор: рассуждение о личности говорящего с замороженной текстовой языковой моделью
Авторы проверяют, можно ли научить замороженную текстовую языковую модель рассуждать о людях по голосу, не превращая её в полноценную звуковую модель. Небольшой проектор переводит эмбеддинг говорящего в четыре мягких токена, которые становятся устойчивым «идентификатором» участника на протяжении длинного разговора.
Метод. Замороженный VoxBlink2 извлекает голосовой эмбеддинг, проектор на 8,5 млн параметров подаёт его в замороженную Qwen3.5-9B. Обучение разделено на распознавание голоса, связывание его с фактами и временное рассуждение. В SpeakerBind 149 шаблонов, 6000 вопросов и истории длиной 138–187 реплик; открытые ответы оценивает GPT-5.6-terra.
Результаты. На VoxCeleb1 точность идентификации остаётся около 97,4–98,36%. На SpeakerBind полный метод получает 70,40% против 71,88% у системы с явными текстовыми метками и 24,21% у варианта только с транскриптом. Если случайно переназначить голосовые связи, результат падает до 2,95%, то есть модель действительно использует голосовой ключ.
Ограничения. Диалоги синтетические и контролируемые, ошибки распознавания речи не являются центральной трудностью. Оценка открытых ответов зависит от другой языковой модели, проверен один основной текстовый каркас. Практическое использование требует отдельного анализа согласия, приватности и хранения голосовых отпечатков.
Фишка из статьи. Обучение всех навыков сразу почти разрушает связывание фактов, хотя распознавание говорящего остаётся высоким. Значит, хорошо разделимые голосовые эмбеддинги ещё не образуют рабочую память: проектору нужно последовательно освоить идентичность, привязку и временные отношения.
| Схема обучения | VoxCeleb-H ↑ | Агрегация фактов ↑ | Временное рассуждение ↑ |
|---|---|---|---|
| Только этап 1 | 93,14% | 47,2% | 73,58% |
| Этапы 1 + 2 | 97,24% | 52,4% | 75,15% |
| Все задачи сразу | 91,09% | 7,0% | 40,85% |
| Полная поэтапная схема | 97,40% | 52,6% | 80,0% |
Как это читать: провал совместного обучения не объясняется одной лишь слабой верификацией — 91,09% на VoxCeleb-H всё ещё высоки, но способность использовать голос как адрес памяти почти исчезает.