голосовые агенты паралингвистика долговременная память
arXiv cs.AI

VoiceLongMemEval: Do Assistants Remember How You Sounded?

arXiv:2609.00570

VoiceLongMemEval проверяет не память о сказанных словах, а память о том, как они были произнесены: с тревогой, паузами, смехом или неуверенностью. Набор полезен тем, что текстовый ответ-ловушка намеренно совместим с расшифровкой, а правильное решение требует паралингвистического свидетельства.

Метод. Всего собрано 523 вопроса и 326 размеченных сеансов; строгая основа из 202 вопросов дважды проходит проверку сильной моделью на неразрешимость по одному тексту. Каждый ход получает метки эмоции, темпа, высоты, громкости, пауз, выделенных слов, голосовых событий, сарказма и неуверенности. Звуковая часть синтезирована Dia-1.6B с опорными фрагментами RAVDESS; прослушивание пропустило 91 из 104 записей.

Результаты. На основной части Claude Opus 4.8 повышает точность с 0,175 по одной расшифровке до 0,558 с описанием подачи, GPT-5.5 — с 0,122 до 0,474; прирост статистически значим. На звуковой подвыборке Qwen2-Audio и Qwen2.5-Omni получают 0,354 и 0,412 против текстовой опоры 0,325. Цепочка Whisper → Opus падает до 0,254: во всех 104 расшифровках Whisper удаляет признаки подачи.

Ограничения. Разговоры и звук синтетические, а полные истории примерно на 100 тыс. токенов пока не проверены: опыты используют только выбранные свидетельства на 10–15 тыс. токенов. Звуковая оценка охватывает две модели размера 7B и четыре голоса. Вопросы и судья частично основаны на языковых моделях, а стойкость фильтра зависит от конкретной подсказки проверяющей модели.

Фишка из статьи. Компактная структурированная запись подачи оказывается полезнее подробного естественного описания.

Представление историиOpus 4.8GPT-5.5
Только расшифровка0,1930,129
Описание подачи фразой0,5890,475
Только метка эмоции0,6140,535
Структурированные метки0,7570,624
Описание + пошаговое рассуждение0,7670,668

Как это читать: одна явная метка эмоции уже превосходит богатое, но свободное описание, а структура добавляет ещё 0,149–0,168 точности. Для системы памяти важна не только сохранность голосовых признаков, но и форма, в которой они передаются рассуждающей модели.

Оригинальная статья на arXiv