TF-MoE: sparse time-frequency experts для speech separation на edge
TF-MoE интересна тем, что смотрит на speech separation через практический bottleneck: многие модели уже имеют мало параметров, но остаются дорогими по MACs/s и плохо подходят для edge inference. Авторы добавляют sparse Mixture-of-Experts не “в LLM-стиле вообще”, а отдельно по временной и частотной осям спектрограммы, чтобы увеличить capacity почти без роста вычислений.
Метод. База — mel-band-splitting TF-Conformer: спектрограмма делится на 80 mel-поддиапазонов, после чего частотный модуль моделирует зависимости между bands, а temporal module — динамику во времени. TF-MoE заменяет feed-forward части Conformer на sparsely gated expert layers: T-MoE выбирает экспертов по time frames, F-MoE — по mel bands. В основном режиме используется top-1 routing, поэтому число параметров растёт, но на каждом шаге активируется только часть expert pool; это и даёт compute-neutral scaling.
Результаты. На Libri2Mix 16 kHz TF-MoE получает SDR 17.7 dB, SI-SDR 17.2 dB, STOI 96.3% и PESQ 2.81 при 4.6M параметров, 4.1 GMACs/s и RTF 0.47 на single-thread laptop CPU для 2.4-секундного примера. Для сравнения, BSRNN при похожем compute имеет SDR 13.9, SI-SDR 13.4 и PESQ 2.31; TF-Conformer без MoE — SDR 16.4 и PESQ 2.63. Более тяжёлые модели вроде TF-GridNet и SPMamba дают около 19-20 dB SDR/SI-SDR, но требуют 323.8 и 238.7 GMACs/s соответственно.
Ограничения. Эксперименты сосредоточены на Libri2Mix, то есть на двухговорящем separation benchmark, а не на полном наборе реальных шумов, реверберации и moving speakers. RTF измерен на коротком 2.4-секундном примере и single-thread CPU, что полезно, но не заменяет profiling на целевом устройстве. Кроме того, слишком большое число экспертов ухудшает результат, поэтому routing не является бесплатным способом бесконечно масштабировать модель.
Фишка из статьи. Самый интересный результат — отрицательная часть ablation: больше экспертов не значит лучше. При одинаковом compute около 4.1 GMACs/s качество растёт до E=12, а затем падает при E=24, вероятно из-за усложнения routing policy.
| Число экспертов E | Params | RTF | SDR ↑ | PESQ ↑ |
|---|---|---|---|---|
| 3 | 2.8M | 0.46 | 16.5 | 2.65 |
| 6 | 3.4M | 0.47 | 17.2 | 2.75 |
| 12 | 4.6M | 0.47 | 17.7 | 2.81 |
| 24 | 7.0M | 0.49 | 16.6 | 2.66 |
Как это читать: ценность TF-MoE не только в +1.3 dB SDR к TF-Conformer, а в показанном trade-off: sparse experts могут добавить качество почти без MACs, но routing capacity нужно подбирать, иначе модель получает больше параметров и хуже разделяет речь.