FormBharo: голосовое заполнение форм на хинди с проверкой всего контура
FormBharo рассматривает голосового агента не как демонстрацию диалога, а как рабочий контур заполнения формы по телефонному разговору на хинди. Это важно для низкоресурсных и сельских сценариев: системе нужно не просто распознать речь, а надежно извлечь поля, переспросить, валидировать значения и не ломаться из-за акустики. Главный вклад статьи - подробная проверка всей цепочки «распознавание речи → языковая модель → логика формы».
Метод. Авторы строят агент для форм материнского и детского здравоохранения, где языковая модель отвечает за извлечение и реплики, а детерминированная логика держит состояние формы и проверяет значения. Для оценки создан FormVoiceAgentBench: 5 симулированных пользователей, 12 полей формы, 4 акустических условия на высказывание, 380 уникальных аудиозаписей, 240 сценариев звонков и 3760 модульных тестов для извлечения и ответа. Сравниваются несколько систем распознавания речи и несколько языковых моделей.
Результаты. По обычному WER лучшей выглядит Nova-3 с 0.826, но по LLM-WER, то есть ошибкам, существенным для последующей модели, лучше Chirp 3 с 0.055 и Scribe v2 с 0.062; Nova-3 имеет LLM-WER 0.104. В извлечении полей с Scribe v2 лучшие модели доходят до 98.94% точности, а в полном заполнении формы - примерно до 93%: Gemini Pro дает 93.47%, Claude Sonnet 93.01%, Gemini3.5 92.50%. Для реального выбора модели авторы учитывают не только точность, но и p95 задержки ниже 5 секунд и стоимость.
Ограничения. Это не полевой эксперимент с реальными пользователями, а тщательно построенная симуляция звонков. Домен узкий: хинди, сельский индийский контекст и медицинско-административная форма. В такой задаче ошибки могут иметь высокую цену, поэтому перед внедрением нужны реальные проверки с шумом, перебиваниями, код-свитчингом и защитой персональных данных.
Фишка из статьи. Полезный отрицательный результат: обычный WER плохо предсказывает пригодность распознавания речи для агента. Модель может иметь лучший WER, но давать больше ошибок именно в тех местах, которые нужны языковой модели для заполнения формы.
| Распознавание речи | WER | LLM-WER | Стоимость в тесте |
|---|---|---|---|
| Scribe v2 | 0.835 | 0.062 | 0.172 |
| Chirp 3 | 0.981 | 0.055 | 0.424 |
| Nova-3 | 0.826 | 0.104 | 0.127 |
| GPT-4o-transcribe | 1.012 | 0.127 | 0.159 |
Как это читать: WER считает все ошибки распознавания, а LLM-WER взвешивает то, что влияет на последующее извлечение полей. Поэтому Nova-3 выглядит лучшей по классической метрике, но хуже подходит для этой формы, чем Scribe v2 или Chirp 3.