речевые языковые модели предобучение распознавание речи
arXiv cs.CL

LPR: локальная реконструкция прототипов для предобучения речевого моста к LLM

arXiv:2610.11159

В системах speech-to-LLM небольшой мост между замороженными аудиоэнкодером и LLM обычно считают технической прослойкой. Работа показывает, что его локальная геометрия определяет переносимость: речевые векторы должны не только глобально совпадать с текстом, но и лежать рядом с лексическими окрестностями входных эмбеддингов LLM.

Метод. LPR заставляет каждый выровненный токен моста восстанавливаться из 16 ближайших замороженных токен-прототипов Llama-3-8B. Двухслойный Q-Former на 177 млн параметров соединяет Whisper-large-v3 и Llama; один многоязычный мост затем отдельно адаптируется к распознаванию и переводу пяти языков.

Результаты. На полном наборе средний WER снижается с 7,75 до 7,22%, BLEU растёт с 39,09 до 41,11. При 43 часах адаптации эффект крупнее: WER 10,28→9,08%, BLEU 35,24→39,49. LPR выигрывает у contrastive pretraining во всех столбцах.

Ограничения. Мост велик сам по себе, эксперименты используют одну пару Whisper/Llama и пять европейских языков. Предобучение требует временных выравниваний токенов; вычисления проводились на H100. Корреляция диагностического показателя с качеством ещё не доказывает единственную причинную связь.

Фишка из статьи. Глобальный retrieval уже насыщается на 0,999 и не различает contrastive и LPR, а локальная ошибка MRE падает с 1,835 до 0,645. Именно MRE сильнее всего коррелирует с выигрышем при малом количестве данных: r=−0,90 для ASR и −0,88 для перевода.

ПредобучениеUtt. R@1MREWER при 43 ч, %BLEU при 43 ч
Без предобучения——10,2835,24
NWP0,6311,88710,2632,68
Contrastive0,9991,83510,2136,55
LPR full0,9990,6459,0839,49

Как это читать: почти идеальное сопоставление целых фраз не гарантирует удобный интерфейс для LLM. Нужна локальная совместимость с её словарным пространством, особенно когда downstream-данных мало.

Оригинальная статья на arXiv