AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking
AVERT возвращает звук в задачу отслеживания состояния устного диалога после того, как основная модель уже приняла решение по расшифровке. Небольшой проверяющий модуль подтверждает значения слотов по акустике и исправляет накопленное состояние между репликами; особенно заметен эффект в длинных разговорах, где ранняя ошибка иначе живёт десятки ходов.
Метод. Базовая модель состояния и текстовый исправитель заморожены. Обучается только проверка значения: WavLM кодирует звук, механизм внимания собирает участок, связанный с предполагаемым значением, а классификатор оценивает акустическое подтверждение. Межходовое голосование может добавить, заменить или оставить значение, но только в допустимых для данного слота пределах; именно это ограничение защищает от лавины правок.
Результаты. На SpokenWOZ совместная точность состояния JGA возрастает с 33,04% у основы до 38,34% после текстового исправителя и 40,13% у полной системы. Проверяющий модуль занимает 56 мс на A100, около 2% времени основной модели, хотя вся последовательная цепочка требует 4,15 с на ход. На ходах 31 и далее относительный выигрыш достигает 19,4%, тогда как на первых пяти ходах он составляет только 0,6%.
Ограничения. Лишь около 21% ошибок имеют буквальное акустическое подтверждение и вообще достижимы для такого исправителя. Пороговые значения и списки слотов настроены под SpokenWOZ, проверена только модель масштаба 1B, а полная задержка остаётся слишком большой для живого помощника. Кроме того, исправления уменьшают пропуски и противоречия, но могут создавать новые галлюцинации.
Фишка из статьи. Общая ошибка уменьшается, однако состав ошибок сдвигается: акустическая проверка лечит накопленные пропуски ценой части новых неверных значений.
| Тип ошибки | Текстовый исправитель | AVERT | Изменение |
|---|---|---|---|
| Пропуск | 9181 | 7693 | −16,2% |
| Противоречие | 7109 | 5916 | −16,8% |
| Галлюцинация | 5834 | 6197 | +6,2% |
| Другое неверное значение | 2415 | 2984 | +23,6% |
Как это читать: итоговое сокращение числа ошибок на 7,1% скрывает важный обмен. Ограниченная проверка хорошо исправляет историю диалога, но её решения нельзя автоматически считать более консервативными; для чувствительных слотов нужен порог отказа или подтверждение пользователем.