AGSC: как не дать omni-модели списывать вместо прослушивания
Статья разбирает неприятную проблему речевых omni-моделей: если дать модели текстовый контекст про сложную сцену, качество на бумаге может резко вырасти, но не потому, что модель лучше слушает. Авторы называют это perception bypass: модель фактически списывает из подсказки и проходит тест даже на тишине. Главный ход работы - заменить ответоносный контекст на аудио-заземленные подсказки AGSC и проверять их через silent-audio control, чтобы подсказка помогала слушать, а не подменяла звук.
Метод строит подсказки из аудио, но ограничивает их информативность: активность целевого диктора, грубый уровень шума и частичные перемешанные слова, полученные через диаризацию, распознавание речи и разделение голосов. Подсказки проходят три защиты: инструкция «сначала слушай», фильтр прямого пересечения с правильным ответом и контроль на тишине. Затем авторы обучают LoRA-адаптеры rank 16, alpha 32: в одном режиме через supervised fine-tuning, где подсказки есть только на части примеров, в другом - через GDPO, где отдельно нормируются награды за формат, решение о включении подсказки и саму расшифровку.
Результаты полезны именно как диагностика. Полный ответ в контексте поднимал среднюю точность трех omni-моделей примерно с 53% до 94%, но при неверном контексте две сильные модели копировали неправильный ответ в 94-99.8% случаев, а на тишине все три давали 100% точности на primary-transcript task. После обучения на AGSC качество без подсказки на перекрытой речи с шумом заметно улучшилось: Qwen3 снизил capped mpWER с 24.7 до 9.2, MiniCPM - с 65.8 до 14.0, Ming - с 71.1 до 15.0. Это означает, что эффект частично перенесся в само поведение модели, а не остался зависимым от тестовой подсказки.
Ограничения существенные. Передний тракт подсказок сам ошибается: coarse SNR level верен в 79% случаев, но точечная оценка SNR имеет среднюю ошибку 9.9 дБ; полный конвейер на 12 оценочных записях дает DER 0.15, верный счет дикторов в 83% клипов и черновой CER 0.20. Full-chain reinforcement использует всего 160 stream-примеров, а для Qwen3 доверительный интервал улучшения no-clue mpWER включает ноль. Поэтому работу лучше читать как сильный протокол проверки утечки контекста и первый результат по internalization, а не как готовый универсальный рецепт для всех речевых ассистентов.
Фишка из статьи. Самый важный результат - не «подсказка улучшила распознавание», а то, что авторы поймали ложное улучшение на тишине и затем показали перенос навыка в режим без подсказки.
| Модель | No clue mpWER до/после | Hardest 1/3 до/после | Gate F1 до/после | Latency до/после |
|---|---|---|---|---|
| Qwen3 | 24.7 -> 9.2 | 49.9 -> 16.8 | 0.727 -> 0.803 | 0.73 с -> 0.20 с |
| MiniCPM | 65.8 -> 14.0 | 86.3 -> 12.8 | 0.720 -> 0.769 | 0.53 с -> 0.17 с |
| Ming | 71.1 -> 15.0 | 96.4 -> 14.9 | 0.522 -> 0.753 | 1.19 с -> 0.23 с |
Как это читать: AGSC полезен не тем, что дает модели еще один текстовый канал, а тем, что авторы заставляют этот канал пройти проверку на «невозможность списать». Таблица показывает два разных эффекта: расшифровка улучшается даже без подсказки, а обученный gate начинает раньше и точнее решать, когда подсказка действительно нужна.