FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation
FireRedAudio пытается объединить распознавание, понимание, синтез и редактирование звука в одной языковой модели на 9 млрд параметров, но не заставляет один звуковой код одинаково хорошо служить всем задачам. Звук, который нужно понять, проходит через компактный перцептивный кодировщик, а речь, которую нужно воспроизвести или отредактировать, - через восстанавливаемое непрерывное представление RedAE. Такой раздельный вход при общей языковой основе оказывается практичнее идеи «одного универсального токена».
Метод. Для понимания 16-кГц звук разбивается на окна до 30 с, кодировщик на основе Whisper-large-v3 и адаптер сжимают его до 12,5 кадров/с. Для порождающих задач причинный RedAE преобразует 24-кГц волну в 64-мерные непрерывные признаки с частотой 25 Гц; семантическая дистилляция от замороженного звукового учителя не даёт скрытому пространству свестись к низкоуровневой акустике. Четыре кадра объединяются в один элемент для Qwen3.5-9B, то есть языковая модель видит 6,25 шага/с. На каждом шаге flow-matching DiT восстанавливает четыре кадра RedAE с контекстом двух предыдущих шагов, а полученный блок возвращается в языковую модель. Обучение разбито на пять стадий, чтобы сначала стабилизировать два входных интерфейса и лишь затем смешивать задачи.
Результаты. Точность понимания достигает 82,0% на MMAU test-mini, 80,9% на MMAU test и 83,3% на MMSU, что выше приведённых сопоставлений. В распознавании модель получает WER 0,67% на LibriSpeech clean и среднюю ошибку 14,94% по 102 языкам FLEURS, хотя не лидирует на каждом отдельном наборе. В синтезе без предварительного знакомства с диктором средняя ошибка содержания равна 1,20%, а сходство голоса 0,71: лучше других универсальных моделей по совокупности, но ниже сильных специализированных синтезаторов по сходству. На шести задачах управляемого синтеза точность составляет 70,1-86,0%. Для длинных записей модель также выдаёт структурированные временные интервалы с общей точностью content@0.5 96,1%.
Ограничения. Это крупный технический отчёт без достаточной оценки вычислительной цены: не приведены RTF, задержка и память порождения, хотя DiT вызывается для каждого 160-мс блока. Часть сравнений получена авторами повторно и использует разные открытые и закрытые системы. Проверка длинных записей основана всего на 50 речевых записях и автоматическом звуковом судье Qwen3.5-Omni-Plus, а не на ручной разметке границ. Специализированные модели всё ещё лучше сохраняют голос диктора, и в статье мало исключающих опытов, отделяющих вклад двух представлений от масштаба данных и пятиступенчатого обучения.
Фишка из статьи. На длинной записи преимущество проявляется не столько в наличии нужного содержания, сколько в компактности временных границ.
| Длительность | FireRedAudio strict@0 | Qwen3.5-Omni-Plus strict@0 | FireRedAudio content@0.5 |
|---|---|---|---|
| 5 мин | 76,9% | 45,9% | 100,0% |
| 10 мин | 68,9% | 53,9% | 99,0% |
| 20 мин | 73,8% | 61,0% | 96,8% |
| 30 мин | 77,7% | 71,1% | 98,4% |
| 50 мин | 72,5% | 47,5% | 93,9% |
| Все | 73,6% | 56,6% | 96,1% |
Как это читать: strict@0 требует полного нужного фрагмента без лишней речи и допускает не более 0,3 с тишины по краям; content@0.5 расширяет обе границы на 0,5 с. Разрыв между столбцами показывает, что содержание находится почти всегда, но точная обрезка остаётся отдельной задачей даже у сильной модели.