Spoken SLU Function Calling Audio LLM
arXiv cs.CL

SpokenFC: вызов функций голосом как жесткий тест аудио-языковых моделей

arXiv:2608.05126

Статья предлагает смотреть на понимание устной речи не только как на распознавание намерения и заполнение слотов, а как на вызов конкретной функции с исполнимыми аргументами. Это более строгая постановка: модель должна понять речь, выбрать API, заполнить параметры, а если данных не хватает - корректно оставить NAN, не придумывая значения. Для голосовых агентов это ближе к реальному риску, чем обычные датасетные метки.

Метод. Авторы строят SpokenFC: набор из 300 инструментов и более 7000 голосовых примеров, разделенных на известные и новые функции. Задачи усложняются по уровням: от одного намерения до сценариев с недостающими параметрами и несколькими ходами. На этом проверяются текстовые языковые модели, каскады "распознавание речи + языковая модель" и аудио-языковые модели; затем Qwen2.5-Omni-7B дообучается через SFT и GRPO с детальными наградами за имя функции, параметры и общий формат.

Результаты. В прямом сравнении формулировка SFC дает лучшее качество, чем традиционная SLU-разметка. Например, для Qwen3-8B с текстовым входом в режиме in-context общая точность на известных функциях растет с 69.73 до 85.70, на новых - с 83.80 до 91.90. Для Qwen2.5-Omni-7B со звуковым входом SFT-вариант SFC дает 80.71 на известных функциях против 75.61 у SLU. Финальная SpokenFC-7B достигает 74.15 общей точности на Test-ID и 75.10 на Test-OOD, при этом сохраняет WER 8.30 на CV15, точность 62.58 на MMSU и общий балл 64.52 на API-Bank.

Ограничения. Бенчмарк проверяет структурированный вызов функций, но не доказывает надежность в продукционном голосовом агенте с шумом, перебиваниями, приватными данными и меняющимися API. Ошибки распознавания имен, чисел и дат остаются главным узким местом. Кроме того, сама схема с NAN полезна для оценки, но в реальном интерфейсе модель часто должна задавать уточняющий вопрос, а не только возвращать пустой аргумент.

Фишка из статьи. Самый показательный результат - не средняя победа SpokenFC-7B, а то, как быстро падают модели на задачах с неполными параметрами.

МодельTest-ID overallLevel 3-2Test-OOD overall
Qwen2.5-Omni-7B48.807.3256.16
GPT-4o-Audio68.3030.3168.09
Gemini-2.5-Pro69.0035.1971.60
SpokenFC-7B74.1540.4275.10

Как это читать: Level 3-2 проверяет не простое распознавание намерения, а умение не галлюцинировать недостающие значения. В качественном разборе даже GPT-4o-Audio подставляет конкретную дату для фразы вроде "this Friday", хотя по протоколу нужно вернуть NAN.

Оригинальная статья на arXiv