речевые LLM CTC следование инструкциям
arXiv cs.CL

DirectSpeech2LLM: прямое подключение речи к LLM без переобучения на одну инструкцию

arXiv:2610.08085

DirectSpeech2LLM борется с типичным переобучением речевых LLM: после обучения только распознаванию речи модель продолжает расшифровывать звук даже по инструкции перевести или определить эмоцию. Авторы выравнивают речевые признаки непосредственно с замороженной таблицей эмбеддингов LLM через геометрический CTC.

Метод. Логиты CTC вычисляются как отрицательные квадраты расстояний до эмбеддингов словаря LLM. Жадные метки CTC задают временное выравнивание, а выбранные векторы подаются в LLM. Две стадии сначала обучают речевой фронтенд, затем интерфейс с языковой моделью; сравниваются blank/no-blank режимы и дополнительная commitment loss.

Результаты. После 1000 часов LibriSpeech Qwen3-4B получает WER 2,21/4,28% на test-clean/test-other, BLEU 19,97 для невиданного en-de и 33,74 для en-zh, а точность эмоций IEMOCAP равна 40,16% при IFR 1,00. Каскадный верхний ориентир даёт 19,88 и 34,03 BLEU. Удаление commitment loss почти не меняет en-de, 19,97→19,69, тогда как у Wav2Prompt удаление MSE обрушает en-es с 13,8 до 5,4.

Ограничения. Обучение всё же ограничено английским ASR, а невиданные задачи проверены на переводе и четырёх эмоциях. Длинная речь остаётся проблемой: на 20 минутах деградируют все варианты. Сложная обработка blank-токена и словарь около 1000 эмбеддингов создают ошибки форматирования и склейки слов.

Фишка из статьи. Переобучение на ASR в значительной степени локализуется в одном blank-эмбеддинге. Модель с blank проваливает невиданный перевод при обычном выводе, но простое удаление blank во время вывода возвращает BLEU почти к каскаду.

Stage 2, Qwen3-4BWER Libri-other, %BLEU en-de
No-blank обучение и вывод4,6319,02
Blank обучение, blank вывод4,285,80
Blank обучение, no-blank вывод5,8319,97
Blank в конце последовательности7,5219,80

Как это читать: фиксированная позиция blank становится коротким признаком «сейчас нужно ASR». Когда этот маркер убрать или переставить, LLM снова слушается новой инструкции, хотя акустические векторы и веса модели не меняются.

Оригинальная статья на arXiv