С кучей Sound'ов работает более-или менее прилично и без тормозов. Только не синхронно

Тем более, что я не пложу ByteArray, а храню их отдельно в Dictionary, используя в качестве ключа путь к mp3. Т.е. если я добавляю один и тот же звук несколько раз, то будет использован один ByteArray.
В случае вашего варианта - конкретный 4-х секундный звук после extract-а занимает 160 Кб. Соответственно, чтобы сложить 2 таких звука я должен сделать около 50 тыс. операций только сложения (2 канала по 32 бита) + еще нужно делить для выравнивания громкости. А если таких звуков хотя бы 10? Да и для юзера всё станет не так прозрачно - перетащил ячейку в секвенсере - получи прогресс бар и несколько секунд задержки

Нет, с микшированием идея интересна, но не вариант
