звуковые языковые модели маршрутизация вызовов стоимость вывода
arXiv cs.SD

Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluation

arXiv:2608.27817

Работа проверяет распространённое предположение, что для закрытой звуковой классификации обязательно нужно вызывать большую порождающую модель. На VocalSound тщательно настроенный маршрутизатор вызывает такую модель лишь для части примеров, но решающий отрицательный результат ещё сильнее: вариант без единого порождающего вызова практически не уступает полной системе.

Метод. Селектор выбирает между расшифровкой, признаками CLAP, AST и WavLM и вызовами Qwen2-Audio, Qwen2.5-Omni или MOSS. Локальные линейные классификаторы обучаются на известных метках задачи; политика оценивает уверенность и решает, нужен ли дорогой вызов. Основная проверка содержит 240 удержанных примеров VocalSound по шести классам, дополнительная — 120 новых примеров ESD.

Результаты. На VocalSound одна расшифровка даёт точность 0,296, WavLM — 0,854, Qwen2-Audio — 0,838. Полная политика достигает 0,925, вызывая генератор для 12,5% примеров; селектор без таких вызовов получает 0,921. Разность 0,004 имеет 95%-й интервал [−0,025; 0,033], то есть преимуществ генератора статистически не видно. На новом ESD разность тоже мала: 0,008 с интервалом [−0,067; 0,083].

Ограничения. Локальные классификаторы получают размеченные примеры именно известной закрытой задачи; вывод нельзя переносить на открытые вопросы и рассуждение. Удержанные выборки малы, а ESD не разделён строго по говорящим. Не измерены память, энергопотребление и задержка сетевого обслуживания, поэтому приведённое время — лишь локальный ориентир.

Фишка из статьи. Полная политика выглядит лучшей по одной точке, но доверительный интервал отвергает содержательный вывод о пользе генеративного вызова. Более того, отказ от него сокращает время с 16,9 до 11,3 с, а точность меняется всего на четыре тысячных.

ПолитикаТочностьДоля вызовов генератораПолное времяВремя генератора
Только расшифровка0,2960%34,4 с0 с
WavLM0,8540%2,5 с0 с
Qwen2-Audio0,838100%31,5 с31,5 с
Селектор без вызовов0,9210%11,3 с0 с
Полная политика0,92512,5%16,9 с5,6 с

Как это читать: выигрыш полной системы над селектором без вызовов находится внутри статистического шума. Для известной классификации сначала стоит исчерпать специализированные представления и калибровку уверенности, а генеративную модель оставлять для примеров, где её добавочная ценность доказана отдельно.

Оригинальная статья на arXiv