Audio LLM RL Reasoning
Аудиорассуждение

AudioRubrics: самообновляющиеся критерии для audio reasoning

MMSU +4.31%

Статья рассматривает audio reasoning не как простую проверку финального ответа, а как задачу, где рассуждение должно быть привязано к услышанному сигналу. Outcome reward говорит модели, угадала ли она ответ, но не объясняет, слушала ли она аудио или воспользовалась текстовым prior. AudioRubrics добавляет процессную награду: для каждого примера генерируются аудио-обоснованные рубрики, которые затем обновляются по rollout модели.

Метод. Для пары audio + question система сначала создает weighted rubrics прямо из waveform, без промежуточной транскрипции как единственного источника. Во время GRPO группа rollout оценивается judge model, неразличающие рубрики отбрасываются, а generator предлагает новые критерии, которые лучше разделяют удачные и слабые рассуждения текущей policy. Итоговая награда сочетает accuracy/format reward, rubric reward и overthinking penalty, чтобы модель не раздувала chain-of-thought ради прохождения критериев.

Результаты. В sweep по весу rubric reward лучший режим gamma=0.50 улучшает accuracy относительно GRPO на трех benchmark: MMAU 75.20 -> 78.00, MMAR 62.20 -> 65.80, MMSU 63.14 -> 65.86. При gamma=0.70 MMSU еще чуть выше, 66.12, но MMAU и MMAR падают, что показывает необходимость баланса между финальным ответом и процессной наградой. На меньшей 3B модели AudioRubrics также улучшает GRPO: 73.00 -> 73.90 на MMAU, 58.30 -> 59.30 на MMAR и 60.26 -> 62.46 на MMSU.

Ограничения. Ключевой компонент - Gemini-3.1-Pro как rubric generator и judge, поэтому стоимость, воспроизводимость и возможные bias судьи важны. Accuracy остается основной итоговой метрикой, а качество рассуждений проверяется через модель-судью. Даже с overthinking penalty остается риск reward hacking, только теперь он переносится в пространство критериев и их интерпретации.

Фишка из статьи. Хороший отрицательный результат - слишком сильная процессная награда начинает вредить. Рубрики полезны, пока они дополняют accuracy reward, но при большом весе модель оптимизирует соответствие критериям вместо правильного ответа.

Вес rubric rewardMMAUMMARMMSUВывод
GRPO75.2062.2063.14только базовая RL-награда
gamma=0.3077.3064.9064.68рубрик уже хватает для роста
gamma=0.5078.0065.8065.86лучший общий баланс
gamma=0.7077.7063.4066.12перекос в process reward
gamma=0.9077.8064.1064.84качество нестабильно

Как это читать: эволюционирующие критерии действительно дают плотный сигнал для аудиорассуждения, но их вес нужно ограничивать. Иначе модель начинает "писать под рубрику", а не только отвечать на вопрос по звуку.

Оригинальная статья на arXiv