Снижение галлюцинаций в LLM-понимании аудио с помощью мультимодальной оптимизации предпочтений
Аудиоязыковая модель может отвечать по языковым шаблонам, почти не опираясь на звук. Авторы расширяют DPO парой «исходное — испорченное аудио»: предпочтительная реплика должна соответствовать правильному звуку, а отвергнутая — тексту и акустически нарушенной версии.
Метод. mDPO объединяет обычную потерю предпочтений, межмодальное сравнение и якорь вероятности правильного ответа. Для Qwen2-Audio-7B строятся отдельные обучающие наборы с разворотом во времени, частотным и временным маскированием и шумом; параметры подбираются на DCASE 2025, затем без настройки переносятся на AH Existence.
Результаты. На DCASE совмещение разворота, шума и частотной маски повышает общую точность с 56,0% до 70,0%, сложных вопросов — с 62,3% до 80,0%. Разворот поднимает временную точность с 39,2% до 44,1%. На AH Existence он повышает точность с 55,6% до 83,0% против 76,7% у контрастного декодирования.
Ограничения. Оба теста сведены к выбору ответа или бинарной проверке существования события; открытая генерация не исследована. Для каждого типа искажения создаётся новый набор предпочтений, обучение использует четыре GPU и LoRA поверх одной 7B-модели. Улучшение точности не измеряет калибровку уверенности и не исключает новых типов галлюцинаций.
Фишка из статьи. Якорная часть функции потерь не декоративна: без неё модель сохраняет относительное предпочтение, но теряет абсолютную вероятность хорошего ответа.
| Функция обучения | Точность DCASE validation |
|---|---|
| Исходная Qwen2-Audio | 56,0% |
| Полный mDPO | 71,4% |
| Без обычного DPO-члена | 70,4% |
| Без межмодального члена | 68,9% |
| Без якорной потери | 64,0% |
Как это читать: наибольший провал даёт удаление якоря, а не основного DPO-члена. Для мультимодальной модели важно не только ранжировать ответы, но и не снижать безусловную правдоподобность правильной генерации во время выравнивания.