Звуковые языковые модели Распознавание и синтез Непрерывные представления
arXiv cs.CL

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

arXiv:2608.24168

FireRedAudio пытается объединить распознавание, понимание, синтез и редактирование звука в одной языковой модели на 9 млрд параметров, но не заставляет один звуковой код одинаково хорошо служить всем задачам. Звук, который нужно понять, проходит через компактный перцептивный кодировщик, а речь, которую нужно воспроизвести или отредактировать, - через восстанавливаемое непрерывное представление RedAE. Такой раздельный вход при общей языковой основе оказывается практичнее идеи «одного универсального токена».

Метод. Для понимания 16-кГц звук разбивается на окна до 30 с, кодировщик на основе Whisper-large-v3 и адаптер сжимают его до 12,5 кадров/с. Для порождающих задач причинный RedAE преобразует 24-кГц волну в 64-мерные непрерывные признаки с частотой 25 Гц; семантическая дистилляция от замороженного звукового учителя не даёт скрытому пространству свестись к низкоуровневой акустике. Четыре кадра объединяются в один элемент для Qwen3.5-9B, то есть языковая модель видит 6,25 шага/с. На каждом шаге flow-matching DiT восстанавливает четыре кадра RedAE с контекстом двух предыдущих шагов, а полученный блок возвращается в языковую модель. Обучение разбито на пять стадий, чтобы сначала стабилизировать два входных интерфейса и лишь затем смешивать задачи.

Результаты. Точность понимания достигает 82,0% на MMAU test-mini, 80,9% на MMAU test и 83,3% на MMSU, что выше приведённых сопоставлений. В распознавании модель получает WER 0,67% на LibriSpeech clean и среднюю ошибку 14,94% по 102 языкам FLEURS, хотя не лидирует на каждом отдельном наборе. В синтезе без предварительного знакомства с диктором средняя ошибка содержания равна 1,20%, а сходство голоса 0,71: лучше других универсальных моделей по совокупности, но ниже сильных специализированных синтезаторов по сходству. На шести задачах управляемого синтеза точность составляет 70,1-86,0%. Для длинных записей модель также выдаёт структурированные временные интервалы с общей точностью content@0.5 96,1%.

Ограничения. Это крупный технический отчёт без достаточной оценки вычислительной цены: не приведены RTF, задержка и память порождения, хотя DiT вызывается для каждого 160-мс блока. Часть сравнений получена авторами повторно и использует разные открытые и закрытые системы. Проверка длинных записей основана всего на 50 речевых записях и автоматическом звуковом судье Qwen3.5-Omni-Plus, а не на ручной разметке границ. Специализированные модели всё ещё лучше сохраняют голос диктора, и в статье мало исключающих опытов, отделяющих вклад двух представлений от масштаба данных и пятиступенчатого обучения.

Фишка из статьи. На длинной записи преимущество проявляется не столько в наличии нужного содержания, сколько в компактности временных границ.

ДлительностьFireRedAudio strict@0Qwen3.5-Omni-Plus strict@0FireRedAudio content@0.5
5 мин76,9%45,9%100,0%
10 мин68,9%53,9%99,0%
20 мин73,8%61,0%96,8%
30 мин77,7%71,1%98,4%
50 мин72,5%47,5%93,9%
Все73,6%56,6%96,1%

Как это читать: strict@0 требует полного нужного фрагмента без лишней речи и допускает не более 0,3 с тишины по краям; content@0.5 расширяет обе границы на 0,5 с. Разрыв между столбцами показывает, что содержание находится почти всегда, но точная обрезка остаётся отдельной задачей даже у сильной модели.

Оригинальная статья на arXiv