Как научить языковую модель слышать, кто что сказал: предобучение Speech-LLM без речевого кодировщика по метаданным
Работа показывает, что речевую языковую модель можно научить различать говорящих и паралингвистические свойства без отдельного предобученного речевого кодировщика. Вместо обычного распознавания модель предварительно учится восстанавливать метаданные — личность диктора, эмоцию, язык и пол — на искусственно составленных многодикторских сценах.
Метод. Metadata-Supervised Pretraining совместно предсказывает текст и доступные описания записи. Speaker-Aware Utterance Composition объединяет реплики с паузами и перекрытиями, сохраняя разметку говорящих, а умеренное маскирование входа мешает модели опираться на локальные подсказки. Затем тот же тракт настраивается на распознавание с указанием говорящего.
Результаты. На AMI вариант без речевого кодировщика после такого предобучения получает WDER 5,38 и cpWER 21,27, а с 15-процентным маскированием — 5,27 и 20,98. На CH109 соответствующие значения равны 2,77/19,08 и 2,65/18,92. В паралингвистике MSP повышает точность распознавания эмоций с 64,30% до 75,66%, а диктора — с 85,81% до 93,16%.
Ограничения. Сцены с несколькими участниками преимущественно синтезированы композицией отдельных записей, а испытания сосредоточены на английских совещаниях. Некоторые варианты используют до миллиона часов дополнительного распознавания речи, что осложняет сравнение стоимости. Потоковая работа и реальные перекрытия вне выбранных корпусов не исследованы.
Фишка из статьи. Обычное предобучение на распознавании уменьшает ошибки слов, но не обязательно помогает установить говорящего. Метаданные и композиция дают самостоятельный выигрыш, а слишком сильное маскирование снова его съедает.
| Предобучение | AMI WDER ↓ | AMI cpWER ↓ | CH109 WDER ↓ | CH109 cpWER ↓ |
|---|---|---|---|---|
| Без предобучения | 6,94 | 25,14 | — | — |
| Только распознавание речи | 6,94 | 23,47 | — | — |
| MSP + композиция с паузами и перекрытиями | 5,38 | 21,27 | 2,77 | 19,08 |
| То же + маскирование 15% | 5,27 | 20,98 | 2,65 | 18,92 |
Как это читать: снижение WDER при одновременном снижении cpWER означает, что модель лучше решает обе части задачи — распознаёт слова и приписывает их правильному человеку. Оптимум при 15% маскирования важен: 48% уже ухудшают результат.