SepRQ: самообучение представлений речевых смесей через безмасочное многомасштабное разделение
Обычные самоконтролируемые речевые модели учатся на одном говорящем и плохо представляют перекрывающуюся речь. SepRQ превращает разделение источников в предтекстовую задачу: модель должна без временной маски восстановить многомасштабные дискретные признаки каждого источника из искусственной смеси.
Метод. Исходные записи на лету смешиваются в двух- и трёхголосные примеры. Случайные проекции и кодовые книги дают псевдоцели на нескольких временных масштабах, а сеть предсказывает их для раздельных выходов с перестановочно-инвариантной потерей. Маскированные кадры не нужны, как и заранее известные эмбеддинги говорящих.
Результаты. На TS-SUPERB SepRQ получает SI-SDRi 12,53 дБ для целевого извлечения против 10,69 у WavLM Base+, а WER целевого ASR с языковой моделью — 16,78% против 20,06%. На DIHARD 3 DER равен 16,1% против 16,6% у WavLM Base+. На WSJ0-3mix трёхисточниковая версия достигает SDRi 17,2 дБ против 13,4 у WavLM Base+, хотя предобучение использует 960 часов вместо примерно 94 тыс.
Ограничения. Смеси создаются искусственно, и обобщение проверено главным образом на англоязычной речи. Трёхисточниковая специализация немного ухудшает двухголосную диаризацию. Сравнение объёмов данных выгодно SepRQ, но не выравнивает архитектуры, вычисления и все детали обучения.
Фишка из статьи. Число источников на предобучении задаёт полезный, но не бесплатный уклон: модель на трёх голосах резко выигрывает именно в трёхголосном разделении, слегка уступая двухголосной версии в диаризации.
| Представление | DIHARD 3 DER, % | WSJ0-2mix SDRi, дБ | WSJ0-3mix SDRi, дБ |
|---|---|---|---|
| WavLM Base+ | 16,6 | 18,2 | 13,4 |
| SepRQ, 2 источника | 16,1 | 19,8 | 14,5 |
| SepRQ, 3 источника | 16,4 | 19,4 | 17,2 |
Как это читать: трёхголосное предобучение не просто масштабирует общий навык разделения, а меняет специализацию представления. Для универсальной модели полезнее смешивать разные порядки или явно управлять этим компромиссом.