Голосовой агент Hindi Evaluation
arXiv cs.CL

FormBharo: голосовое заполнение форм на хинди с проверкой всего контура

arXiv:2608.06027

FormBharo рассматривает голосового агента не как демонстрацию диалога, а как рабочий контур заполнения формы по телефонному разговору на хинди. Это важно для низкоресурсных и сельских сценариев: системе нужно не просто распознать речь, а надежно извлечь поля, переспросить, валидировать значения и не ломаться из-за акустики. Главный вклад статьи - подробная проверка всей цепочки «распознавание речи → языковая модель → логика формы».

Метод. Авторы строят агент для форм материнского и детского здравоохранения, где языковая модель отвечает за извлечение и реплики, а детерминированная логика держит состояние формы и проверяет значения. Для оценки создан FormVoiceAgentBench: 5 симулированных пользователей, 12 полей формы, 4 акустических условия на высказывание, 380 уникальных аудиозаписей, 240 сценариев звонков и 3760 модульных тестов для извлечения и ответа. Сравниваются несколько систем распознавания речи и несколько языковых моделей.

Результаты. По обычному WER лучшей выглядит Nova-3 с 0.826, но по LLM-WER, то есть ошибкам, существенным для последующей модели, лучше Chirp 3 с 0.055 и Scribe v2 с 0.062; Nova-3 имеет LLM-WER 0.104. В извлечении полей с Scribe v2 лучшие модели доходят до 98.94% точности, а в полном заполнении формы - примерно до 93%: Gemini Pro дает 93.47%, Claude Sonnet 93.01%, Gemini3.5 92.50%. Для реального выбора модели авторы учитывают не только точность, но и p95 задержки ниже 5 секунд и стоимость.

Ограничения. Это не полевой эксперимент с реальными пользователями, а тщательно построенная симуляция звонков. Домен узкий: хинди, сельский индийский контекст и медицинско-административная форма. В такой задаче ошибки могут иметь высокую цену, поэтому перед внедрением нужны реальные проверки с шумом, перебиваниями, код-свитчингом и защитой персональных данных.

Фишка из статьи. Полезный отрицательный результат: обычный WER плохо предсказывает пригодность распознавания речи для агента. Модель может иметь лучший WER, но давать больше ошибок именно в тех местах, которые нужны языковой модели для заполнения формы.

Распознавание речиWERLLM-WERСтоимость в тесте
Scribe v20.8350.0620.172
Chirp 30.9810.0550.424
Nova-30.8260.1040.127
GPT-4o-transcribe1.0120.1270.159

Как это читать: WER считает все ошибки распознавания, а LLM-WER взвешивает то, что влияет на последующее извлечение полей. Поэтому Nova-3 выглядит лучшей по классической метрике, но хуже подходит для этой формы, чем Scribe v2 или Chirp 3.

Оригинальная статья на arXiv