устный диалог состояние диалога проверка по звуку
arXiv cs.CL

AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking

arXiv:2609.01828

AVERT возвращает звук в задачу отслеживания состояния устного диалога после того, как основная модель уже приняла решение по расшифровке. Небольшой проверяющий модуль подтверждает значения слотов по акустике и исправляет накопленное состояние между репликами; особенно заметен эффект в длинных разговорах, где ранняя ошибка иначе живёт десятки ходов.

Метод. Базовая модель состояния и текстовый исправитель заморожены. Обучается только проверка значения: WavLM кодирует звук, механизм внимания собирает участок, связанный с предполагаемым значением, а классификатор оценивает акустическое подтверждение. Межходовое голосование может добавить, заменить или оставить значение, но только в допустимых для данного слота пределах; именно это ограничение защищает от лавины правок.

Результаты. На SpokenWOZ совместная точность состояния JGA возрастает с 33,04% у основы до 38,34% после текстового исправителя и 40,13% у полной системы. Проверяющий модуль занимает 56 мс на A100, около 2% времени основной модели, хотя вся последовательная цепочка требует 4,15 с на ход. На ходах 31 и далее относительный выигрыш достигает 19,4%, тогда как на первых пяти ходах он составляет только 0,6%.

Ограничения. Лишь около 21% ошибок имеют буквальное акустическое подтверждение и вообще достижимы для такого исправителя. Пороговые значения и списки слотов настроены под SpokenWOZ, проверена только модель масштаба 1B, а полная задержка остаётся слишком большой для живого помощника. Кроме того, исправления уменьшают пропуски и противоречия, но могут создавать новые галлюцинации.

Фишка из статьи. Общая ошибка уменьшается, однако состав ошибок сдвигается: акустическая проверка лечит накопленные пропуски ценой части новых неверных значений.

Тип ошибкиТекстовый исправительAVERTИзменение
Пропуск91817693−16,2%
Противоречие71095916−16,8%
Галлюцинация58346197+6,2%
Другое неверное значение24152984+23,6%

Как это читать: итоговое сокращение числа ошибок на 7,1% скрывает важный обмен. Ограниченная проверка хорошо исправляет историю диалога, но её решения нельзя автоматически считать более консервативными; для чувствительных слотов нужен порог отказа или подтверждение пользователем.

Оригинальная статья на arXiv