Music source separation stems scheiden
Werking van source separation
Music source separation is het proces waarbij een gemengde muziekopname wordt opgesplitst in afzonderlijke componenten, ook wel stems genoemd. Bijvoorbeeld: zang, drums, bas en overige instrumenten. Dit wordt gebruikt voor remixen, karaoke, muziekproductie en onderwijs. Traditionele methoden gebruikten spectrale filtering en independent component analysis (ICA). Moderne methoden gebruiken deep learning, vaak met convolutionele neurale netwerken of transformers. Modellen zoals Demucs, Spleeter en Open-Unmix zijn populaire open-source tools. Ze werken in het tijdsdomein of het frequentiedomein en leren om de verschillende bronnen te scheiden. Source separation is uitdagend omdat instrumenten overlappen in frequentie en tijd. Ook het scheiden van zang van instrumenten met vergelijkbare frequenties is lastig. Desondanks zijn de resultaten de afgelopen jaren sterk verbeterd.
Toepassingen en evaluatie
Music source separation wordt gebruikt in de muziekindustrie voor het maken van remixen, het isoleren van instrumenten voor samples en het produceren van karaokeversies. Het wordt ook gebruikt in onderwijs, waar studenten individuele instrumenten kunnen bestuderen. Evaluatie gebeurt met metrieken zoals Signal-to-Distortion Ratio (SDR), Signal-to-Interference Ratio (SIR) en Signal-to-Artifact Ratio (SAR). SDR meet de algehele kwaliteit, SIR meet de mate van interferentie van andere bronnen en SAR meet artefacten. Het is een actief onderzoeksgebied met focus op realtime verwerking, meer bronnen en betere kwaliteit. Source separation is een van de meest tastbare toepassingen van audio-AI.