AudioRubrics: самообновляющиеся критерии для audio reasoning
Статья рассматривает audio reasoning не как простую проверку финального ответа, а как задачу, где рассуждение должно быть привязано к услышанному сигналу. Outcome reward говорит модели, угадала ли она ответ, но не объясняет, слушала ли она аудио или воспользовалась текстовым prior. AudioRubrics добавляет процессную награду: для каждого примера генерируются аудио-обоснованные рубрики, которые затем обновляются по rollout модели.
Метод. Для пары audio + question система сначала создает weighted rubrics прямо из waveform, без промежуточной транскрипции как единственного источника. Во время GRPO группа rollout оценивается judge model, неразличающие рубрики отбрасываются, а generator предлагает новые критерии, которые лучше разделяют удачные и слабые рассуждения текущей policy. Итоговая награда сочетает accuracy/format reward, rubric reward и overthinking penalty, чтобы модель не раздувала chain-of-thought ради прохождения критериев.
Результаты. В sweep по весу rubric reward лучший режим gamma=0.50 улучшает accuracy относительно GRPO на трех benchmark: MMAU 75.20 -> 78.00, MMAR 62.20 -> 65.80, MMSU 63.14 -> 65.86. При gamma=0.70 MMSU еще чуть выше, 66.12, но MMAU и MMAR падают, что показывает необходимость баланса между финальным ответом и процессной наградой. На меньшей 3B модели AudioRubrics также улучшает GRPO: 73.00 -> 73.90 на MMAU, 58.30 -> 59.30 на MMAR и 60.26 -> 62.46 на MMSU.
Ограничения. Ключевой компонент - Gemini-3.1-Pro как rubric generator и judge, поэтому стоимость, воспроизводимость и возможные bias судьи важны. Accuracy остается основной итоговой метрикой, а качество рассуждений проверяется через модель-судью. Даже с overthinking penalty остается риск reward hacking, только теперь он переносится в пространство критериев и их интерпретации.
Фишка из статьи. Хороший отрицательный результат - слишком сильная процессная награда начинает вредить. Рубрики полезны, пока они дополняют accuracy reward, но при большом весе модель оптимизирует соответствие критериям вместо правильного ответа.
| Вес rubric reward | MMAU | MMAR | MMSU | Вывод |
|---|---|---|---|---|
| GRPO | 75.20 | 62.20 | 63.14 | только базовая RL-награда |
| gamma=0.30 | 77.30 | 64.90 | 64.68 | рубрик уже хватает для роста |
| gamma=0.50 | 78.00 | 65.80 | 65.86 | лучший общий баланс |
| gamma=0.70 | 77.70 | 63.40 | 66.12 | перекос в process reward |
| gamma=0.90 | 77.80 | 64.10 | 64.84 | качество нестабильно |
Как это читать: эволюционирующие критерии действительно дают плотный сигнал для аудиорассуждения, но их вес нужно ограничивать. Иначе модель начинает "писать под рубрику", а не только отвечать на вопрос по звуку.