аудиоязыковые модели галлюцинации оптимизация предпочтений
arXiv cs.SD

Снижение галлюцинаций в LLM-понимании аудио с помощью мультимодальной оптимизации предпочтений

arXiv:2610.04004

Аудиоязыковая модель может отвечать по языковым шаблонам, почти не опираясь на звук. Авторы расширяют DPO парой «исходное — испорченное аудио»: предпочтительная реплика должна соответствовать правильному звуку, а отвергнутая — тексту и акустически нарушенной версии.

Метод. mDPO объединяет обычную потерю предпочтений, межмодальное сравнение и якорь вероятности правильного ответа. Для Qwen2-Audio-7B строятся отдельные обучающие наборы с разворотом во времени, частотным и временным маскированием и шумом; параметры подбираются на DCASE 2025, затем без настройки переносятся на AH Existence.

Результаты. На DCASE совмещение разворота, шума и частотной маски повышает общую точность с 56,0% до 70,0%, сложных вопросов — с 62,3% до 80,0%. Разворот поднимает временную точность с 39,2% до 44,1%. На AH Existence он повышает точность с 55,6% до 83,0% против 76,7% у контрастного декодирования.

Ограничения. Оба теста сведены к выбору ответа или бинарной проверке существования события; открытая генерация не исследована. Для каждого типа искажения создаётся новый набор предпочтений, обучение использует четыре GPU и LoRA поверх одной 7B-модели. Улучшение точности не измеряет калибровку уверенности и не исключает новых типов галлюцинаций.

Фишка из статьи. Якорная часть функции потерь не декоративна: без неё модель сохраняет относительное предпочтение, но теряет абсолютную вероятность хорошего ответа.

Функция обученияТочность DCASE validation
Исходная Qwen2-Audio56,0%
Полный mDPO71,4%
Без обычного DPO-члена70,4%
Без межмодального члена68,9%
Без якорной потери64,0%

Как это читать: наибольший провал даёт удаление якоря, а не основного DPO-члена. Для мультимодальной модели важно не только ранжировать ответы, но и не снижать безусловную правдоподобность правильной генерации во время выравнивания.

Оригинальная статья на arXiv