SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning
SpeechGym обучает голосового агента непосредственно на звуковом диалоге и вызовах инструментов, без промежуточной цепочки распознавания и синтеза речи. Ценность работы не только в росте успешности: авторы показывают, что обычная итоговая награда почти всегда обнуляет градиент в длинном разговоре, а небольшая пошаговая награда за корректный вызов инструмента радикально меняет обучаемость.
Метод. Агент и замороженный имитатор пользователя построены на Qwen3-Omni-30B-A3B; у агента обучаются LoRA-параметры мыслительного блока методом GRPO. Сценарии и инструменты взяты из τ2-bench для авиакомпании, розницы, связи и банковских задач. Весь цикл, включая генерацию звука, работает на одном узле с восемью H200. Специализированный vLLM-Omni сокращает время эпохи в 5,4 раза и устраняет платные обращения к внешним речевым службам, которые стоили бы более 200 долларов за эпоху.
Результаты. На внешнем τ-Voice без дополнительной настройки средний pass@1 растёт с 24% до 53%: авиакомпания — с 24% до 62%, розница — с 45% до 73%, связь — с 4% до 24%. Доля ошибочных записывающих операций падает с 23% до 10%, зацикленных диалогов — с 14% до 5%, а восстановление после неверно услышанного значения растёт с 42% до 62%. Средняя длина фиксированных задач сокращается с 23,4 до 17,5 хода.
Ограничения. В обучении обе стороны используют одно семейство Qwen, поэтому симулятор может закреплять собственные речевые привычки модели. Внешняя проверка меняет звуковой тракт, но сохраняет тот же класс служебных задач. Нужны восемь H200; нет разговоров с реальными людьми, субъективной оценки естественности и анализа редких опасных вызовов инструментов.
Фишка из статьи. Итоговая бинарная награда выглядит принципиально недостаточной: в 84% групп все траектории получают одинаковый исход и GRPO не видит направления обновления. Всего 0,1 балла за удачный промежуточный вызов инструмента почти полностью устраняет эту «голодную» обратную связь.
| Схема награды | Группы с полезным градиентом | Пропущенные группы |
|---|---|---|
| Только итог задачи | 16,0% | 84,0% |
| Итог + 0,1 за корректный вызов | 99,6% | 0,4% |
Как это читать: прибавка не столько «подсказывает ответ», сколько различает частично успешные траектории внутри одной группы. Именно это, а не средняя итоговая награда, объясняет, почему обучение длинному голосовому взаимодействию вообще начинает двигаться.