речевые языковые модели диаризация паралингвистика
arXiv eess.AS

Как научить языковую модель слышать, кто что сказал: предобучение Speech-LLM без речевого кодировщика по метаданным

arXiv:2610.01695

Работа показывает, что речевую языковую модель можно научить различать говорящих и паралингвистические свойства без отдельного предобученного речевого кодировщика. Вместо обычного распознавания модель предварительно учится восстанавливать метаданные — личность диктора, эмоцию, язык и пол — на искусственно составленных многодикторских сценах.

Метод. Metadata-Supervised Pretraining совместно предсказывает текст и доступные описания записи. Speaker-Aware Utterance Composition объединяет реплики с паузами и перекрытиями, сохраняя разметку говорящих, а умеренное маскирование входа мешает модели опираться на локальные подсказки. Затем тот же тракт настраивается на распознавание с указанием говорящего.

Результаты. На AMI вариант без речевого кодировщика после такого предобучения получает WDER 5,38 и cpWER 21,27, а с 15-процентным маскированием — 5,27 и 20,98. На CH109 соответствующие значения равны 2,77/19,08 и 2,65/18,92. В паралингвистике MSP повышает точность распознавания эмоций с 64,30% до 75,66%, а диктора — с 85,81% до 93,16%.

Ограничения. Сцены с несколькими участниками преимущественно синтезированы композицией отдельных записей, а испытания сосредоточены на английских совещаниях. Некоторые варианты используют до миллиона часов дополнительного распознавания речи, что осложняет сравнение стоимости. Потоковая работа и реальные перекрытия вне выбранных корпусов не исследованы.

Фишка из статьи. Обычное предобучение на распознавании уменьшает ошибки слов, но не обязательно помогает установить говорящего. Метаданные и композиция дают самостоятельный выигрыш, а слишком сильное маскирование снова его съедает.

ПредобучениеAMI WDER ↓AMI cpWER ↓CH109 WDER ↓CH109 cpWER ↓
Без предобучения6,9425,14——
Только распознавание речи6,9423,47——
MSP + композиция с паузами и перекрытиями5,3821,272,7719,08
То же + маскирование 15%5,2720,982,6518,92

Как это читать: снижение WDER при одновременном снижении cpWER означает, что модель лучше решает обе части задачи — распознаёт слова и приписывает их правильному человеку. Оптимум при 15% маскирования важен: 48% уже ухудшают результат.

Оригинальная статья на arXiv