DirectSpeech2LLM: прямое подключение речи к LLM без переобучения на одну инструкцию
DirectSpeech2LLM борется с типичным переобучением речевых LLM: после обучения только распознаванию речи модель продолжает расшифровывать звук даже по инструкции перевести или определить эмоцию. Авторы выравнивают речевые признаки непосредственно с замороженной таблицей эмбеддингов LLM через геометрический CTC.
Метод. Логиты CTC вычисляются как отрицательные квадраты расстояний до эмбеддингов словаря LLM. Жадные метки CTC задают временное выравнивание, а выбранные векторы подаются в LLM. Две стадии сначала обучают речевой фронтенд, затем интерфейс с языковой моделью; сравниваются blank/no-blank режимы и дополнительная commitment loss.
Результаты. После 1000 часов LibriSpeech Qwen3-4B получает WER 2,21/4,28% на test-clean/test-other, BLEU 19,97 для невиданного en-de и 33,74 для en-zh, а точность эмоций IEMOCAP равна 40,16% при IFR 1,00. Каскадный верхний ориентир даёт 19,88 и 34,03 BLEU. Удаление commitment loss почти не меняет en-de, 19,97→19,69, тогда как у Wav2Prompt удаление MSE обрушает en-es с 13,8 до 5,4.
Ограничения. Обучение всё же ограничено английским ASR, а невиданные задачи проверены на переводе и четырёх эмоциях. Длинная речь остаётся проблемой: на 20 минутах деградируют все варианты. Сложная обработка blank-токена и словарь около 1000 эмбеддингов создают ошибки форматирования и склейки слов.
Фишка из статьи. Переобучение на ASR в значительной степени локализуется в одном blank-эмбеддинге. Модель с blank проваливает невиданный перевод при обычном выводе, но простое удаление blank во время вывода возвращает BLEU почти к каскаду.
| Stage 2, Qwen3-4B | WER Libri-other, % | BLEU en-de |
|---|---|---|
| No-blank обучение и вывод | 4,63 | 19,02 |
| Blank обучение, blank вывод | 4,28 | 5,80 |
| Blank обучение, no-blank вывод | 5,83 | 19,97 |
| Blank в конце последовательности | 7,52 | 19,80 |
Как это читать: фиксированная позиция blank становится коротким признаком «сейчас нужно ASR». Когда этот маркер убрать или переставить, LLM снова слушается новой инструкции, хотя акустические векторы и веса модели не меняются.