LPR: локальная реконструкция прототипов для предобучения речевого моста к LLM
В системах speech-to-LLM небольшой мост между замороженными аудиоэнкодером и LLM обычно считают технической прослойкой. Работа показывает, что его локальная геометрия определяет переносимость: речевые векторы должны не только глобально совпадать с текстом, но и лежать рядом с лексическими окрестностями входных эмбеддингов LLM.
Метод. LPR заставляет каждый выровненный токен моста восстанавливаться из 16 ближайших замороженных токен-прототипов Llama-3-8B. Двухслойный Q-Former на 177 млн параметров соединяет Whisper-large-v3 и Llama; один многоязычный мост затем отдельно адаптируется к распознаванию и переводу пяти языков.
Результаты. На полном наборе средний WER снижается с 7,75 до 7,22%, BLEU растёт с 39,09 до 41,11. При 43 часах адаптации эффект крупнее: WER 10,28→9,08%, BLEU 35,24→39,49. LPR выигрывает у contrastive pretraining во всех столбцах.
Ограничения. Мост велик сам по себе, эксперименты используют одну пару Whisper/Llama и пять европейских языков. Предобучение требует временных выравниваний токенов; вычисления проводились на H100. Корреляция диагностического показателя с качеством ещё не доказывает единственную причинную связь.
Фишка из статьи. Глобальный retrieval уже насыщается на 0,999 и не различает contrastive и LPR, а локальная ошибка MRE падает с 1,835 до 0,645. Именно MRE сильнее всего коррелирует с выигрышем при малом количестве данных: r=−0,90 для ASR и −0,88 для перевода.
| Предобучение | Utt. R@1 | MRE | WER при 43 ч, % | BLEU при 43 ч |
|---|---|---|---|---|
| Без предобучения | — | — | 10,28 | 35,24 |
| NWP | 0,631 | 1,887 | 10,26 | 32,68 |
| Contrastive | 0,999 | 1,835 | 10,21 | 36,55 |
| LPR full | 0,999 | 0,645 | 9,08 | 39,49 |
Как это читать: почти идеальное сопоставление целых фраз не гарантирует удобный интерфейс для LLM. Нужна локальная совместимость с её словарным пространством, особенно когда downstream-данных мало.