SpokenFC: вызов функций голосом как жесткий тест аудио-языковых моделей
Статья предлагает смотреть на понимание устной речи не только как на распознавание намерения и заполнение слотов, а как на вызов конкретной функции с исполнимыми аргументами. Это более строгая постановка: модель должна понять речь, выбрать API, заполнить параметры, а если данных не хватает - корректно оставить NAN, не придумывая значения. Для голосовых агентов это ближе к реальному риску, чем обычные датасетные метки.
Метод. Авторы строят SpokenFC: набор из 300 инструментов и более 7000 голосовых примеров, разделенных на известные и новые функции. Задачи усложняются по уровням: от одного намерения до сценариев с недостающими параметрами и несколькими ходами. На этом проверяются текстовые языковые модели, каскады "распознавание речи + языковая модель" и аудио-языковые модели; затем Qwen2.5-Omni-7B дообучается через SFT и GRPO с детальными наградами за имя функции, параметры и общий формат.
Результаты. В прямом сравнении формулировка SFC дает лучшее качество, чем традиционная SLU-разметка. Например, для Qwen3-8B с текстовым входом в режиме in-context общая точность на известных функциях растет с 69.73 до 85.70, на новых - с 83.80 до 91.90. Для Qwen2.5-Omni-7B со звуковым входом SFT-вариант SFC дает 80.71 на известных функциях против 75.61 у SLU. Финальная SpokenFC-7B достигает 74.15 общей точности на Test-ID и 75.10 на Test-OOD, при этом сохраняет WER 8.30 на CV15, точность 62.58 на MMSU и общий балл 64.52 на API-Bank.
Ограничения. Бенчмарк проверяет структурированный вызов функций, но не доказывает надежность в продукционном голосовом агенте с шумом, перебиваниями, приватными данными и меняющимися API. Ошибки распознавания имен, чисел и дат остаются главным узким местом. Кроме того, сама схема с NAN полезна для оценки, но в реальном интерфейсе модель часто должна задавать уточняющий вопрос, а не только возвращать пустой аргумент.
Фишка из статьи. Самый показательный результат - не средняя победа SpokenFC-7B, а то, как быстро падают модели на задачах с неполными параметрами.
| Модель | Test-ID overall | Level 3-2 | Test-OOD overall |
|---|---|---|---|
| Qwen2.5-Omni-7B | 48.80 | 7.32 | 56.16 |
| GPT-4o-Audio | 68.30 | 30.31 | 68.09 |
| Gemini-2.5-Pro | 69.00 | 35.19 | 71.60 |
| SpokenFC-7B | 74.15 | 40.42 | 75.10 |
Как это читать: Level 3-2 проверяет не простое распознавание намерения, а умение не галлюцинировать недостающие значения. В качественном разборе даже GPT-4o-Audio подставляет конкретную дату для фразы вроде "this Friday", хотя по протоколу нужно вернуть NAN.