Распознавание речи Перекрытая речь Контекст
Речевые omni-модели

AGSC: как не дать omni-модели списывать вместо прослушивания

mpWER 9-15%

Статья разбирает неприятную проблему речевых omni-моделей: если дать модели текстовый контекст про сложную сцену, качество на бумаге может резко вырасти, но не потому, что модель лучше слушает. Авторы называют это perception bypass: модель фактически списывает из подсказки и проходит тест даже на тишине. Главный ход работы - заменить ответоносный контекст на аудио-заземленные подсказки AGSC и проверять их через silent-audio control, чтобы подсказка помогала слушать, а не подменяла звук.

Метод строит подсказки из аудио, но ограничивает их информативность: активность целевого диктора, грубый уровень шума и частичные перемешанные слова, полученные через диаризацию, распознавание речи и разделение голосов. Подсказки проходят три защиты: инструкция «сначала слушай», фильтр прямого пересечения с правильным ответом и контроль на тишине. Затем авторы обучают LoRA-адаптеры rank 16, alpha 32: в одном режиме через supervised fine-tuning, где подсказки есть только на части примеров, в другом - через GDPO, где отдельно нормируются награды за формат, решение о включении подсказки и саму расшифровку.

Результаты полезны именно как диагностика. Полный ответ в контексте поднимал среднюю точность трех omni-моделей примерно с 53% до 94%, но при неверном контексте две сильные модели копировали неправильный ответ в 94-99.8% случаев, а на тишине все три давали 100% точности на primary-transcript task. После обучения на AGSC качество без подсказки на перекрытой речи с шумом заметно улучшилось: Qwen3 снизил capped mpWER с 24.7 до 9.2, MiniCPM - с 65.8 до 14.0, Ming - с 71.1 до 15.0. Это означает, что эффект частично перенесся в само поведение модели, а не остался зависимым от тестовой подсказки.

Ограничения существенные. Передний тракт подсказок сам ошибается: coarse SNR level верен в 79% случаев, но точечная оценка SNR имеет среднюю ошибку 9.9 дБ; полный конвейер на 12 оценочных записях дает DER 0.15, верный счет дикторов в 83% клипов и черновой CER 0.20. Full-chain reinforcement использует всего 160 stream-примеров, а для Qwen3 доверительный интервал улучшения no-clue mpWER включает ноль. Поэтому работу лучше читать как сильный протокол проверки утечки контекста и первый результат по internalization, а не как готовый универсальный рецепт для всех речевых ассистентов.

Фишка из статьи. Самый важный результат - не «подсказка улучшила распознавание», а то, что авторы поймали ложное улучшение на тишине и затем показали перенос навыка в режим без подсказки.

МодельNo clue mpWER до/послеHardest 1/3 до/послеGate F1 до/послеLatency до/после
Qwen324.7 -> 9.249.9 -> 16.80.727 -> 0.8030.73 с -> 0.20 с
MiniCPM65.8 -> 14.086.3 -> 12.80.720 -> 0.7690.53 с -> 0.17 с
Ming71.1 -> 15.096.4 -> 14.90.522 -> 0.7531.19 с -> 0.23 с

Как это читать: AGSC полезен не тем, что дает модели еще один текстовый канал, а тем, что авторы заставляют этот канал пройти проверку на «невозможность списать». Таблица показывает два разных эффекта: расшифровка улучшается даже без подсказки, а обученный gate начинает раньше и точнее решать, когда подсказка действительно нужна.

Оригинальная статья на arXiv