разделение речи фаза разреженные эксперты
arXiv eess.AS

SEAL: аддитивное восстановление смеси и маршрутизация экспертов для эффективного разделения речи

arXiv:2610.07047

SEAL исправляет слабое место компактных частотно-временных разделителей: ограниченная мультипликативная маска не может восстановить компоненту, исчезнувшую из смеси из-за фазового взаимного уничтожения. Вместо расширения всей сети авторы добавляют сохраняющий смесь комплексный остаток и направляют каждый частотно-временной токен к одному из шести небольших экспертов.

Метод. Остатки источников суммируются в ноль, поэтому реконструированные сигналы точно складываются обратно в наблюдаемую смесь. Амплитуда поправки ограничена локальной энергией, а маршрутизатор использует текущие признаки, изменение между итерациями и временную статистику. Общая рекуррентная ячейка остаётся общей, эксперты обслуживают только редкие остаточные поправки.

Результаты. SEAL-small получает 12,89 дБ SI-SDRi на EchoSet против 12,58 у TIGER-small, имея 0,59 млн параметров вместо 0,82 млн и 2,64 против 7,65 GMAC. На одном CPU-потоке секунда звука обрабатывается за 247 мс против 1211 мс; на RTX 5090 за 32,7 против 43,5 мс. SEAL-large отстаёт от TIGER-large лишь на 0,07 дБ SI-SDRi при втрое меньших вычислениях.

Ограничения. Все конфигурации обучены по одному разу, поэтому разброс по случайным инициализациям неизвестен. Эксперимент ограничен EchoSet и двухговорящей смесью; квадратичное временное внимание начинает сказываться на длинных записях. Измеренная задержка зависит от RTX 5090 и конкретного CPU.

Фишка из статьи. Аддитивный остаток действительно работает именно в фазово скомпенсированных ячейках, а не служит общей добавочной ёмкостью: там он снижает нормированную ошибку на 38%.

Абляция SEAL-smallSI-SDRi, дБИзменение, дБ
Полная модель12,890
Без аддитивного остатка11,85-1,04
Один атом остатка12,34-0,55
Плотный выход вместо экспертов11,99-0,90
Фиксированная хеш-маршрутизация12,57-0,32

Как это читать: основной выигрыш даёт не одна «более умная» часть. Комплексный остаток возвращает достижимые решения в ячейках с фазовым уничтожением, а обучаемая маршрутизация распределяет эту поправку по специализированным экспертам почти без роста MAC.

Оригинальная статья на arXiv