SEAL: аддитивное восстановление смеси и маршрутизация экспертов для эффективного разделения речи
SEAL исправляет слабое место компактных частотно-временных разделителей: ограниченная мультипликативная маска не может восстановить компоненту, исчезнувшую из смеси из-за фазового взаимного уничтожения. Вместо расширения всей сети авторы добавляют сохраняющий смесь комплексный остаток и направляют каждый частотно-временной токен к одному из шести небольших экспертов.
Метод. Остатки источников суммируются в ноль, поэтому реконструированные сигналы точно складываются обратно в наблюдаемую смесь. Амплитуда поправки ограничена локальной энергией, а маршрутизатор использует текущие признаки, изменение между итерациями и временную статистику. Общая рекуррентная ячейка остаётся общей, эксперты обслуживают только редкие остаточные поправки.
Результаты. SEAL-small получает 12,89 дБ SI-SDRi на EchoSet против 12,58 у TIGER-small, имея 0,59 млн параметров вместо 0,82 млн и 2,64 против 7,65 GMAC. На одном CPU-потоке секунда звука обрабатывается за 247 мс против 1211 мс; на RTX 5090 за 32,7 против 43,5 мс. SEAL-large отстаёт от TIGER-large лишь на 0,07 дБ SI-SDRi при втрое меньших вычислениях.
Ограничения. Все конфигурации обучены по одному разу, поэтому разброс по случайным инициализациям неизвестен. Эксперимент ограничен EchoSet и двухговорящей смесью; квадратичное временное внимание начинает сказываться на длинных записях. Измеренная задержка зависит от RTX 5090 и конкретного CPU.
Фишка из статьи. Аддитивный остаток действительно работает именно в фазово скомпенсированных ячейках, а не служит общей добавочной ёмкостью: там он снижает нормированную ошибку на 38%.
| Абляция SEAL-small | SI-SDRi, дБ | Изменение, дБ |
|---|---|---|
| Полная модель | 12,89 | 0 |
| Без аддитивного остатка | 11,85 | -1,04 |
| Один атом остатка | 12,34 | -0,55 |
| Плотный выход вместо экспертов | 11,99 | -0,90 |
| Фиксированная хеш-маршрутизация | 12,57 | -0,32 |
Как это читать: основной выигрыш даёт не одна «более умная» часть. Комплексный остаток возвращает достижимые решения в ячейках с фазовым уничтожением, а обучаемая маршрутизация распределяет эту поправку по специализированным экспертам почти без роста MAC.