Wat is dimensionality reduction dimensiereductie?
Waarom dimensiereductie?
Datasets kunnen honderden of duizenden features bevatten. Dit leidt tot de curse of dimensionality: datapunten worden schaars, afstanden verliezen betekenis en modellen overfitten gemakkelijker. Dimensiereductie pakt dit aan door een kleinere set variabelen te creëren die de originele data zo goed mogelijk representeert. Dit verbetert de efficiëntie, vermindert ruis en maakt visualisatie in 2D of 3D mogelijk. Het wordt toegepast in beeldverwerking, genomics, NLP en recommendation systems. Er bestaan lineaire en niet-lineaire methoden, elk met eigen voor- en nadelen. De keuze hangt af van de aard van de data en het doel: exploratie, compressie of voorbereiding voor een ander model.
Lineaire en niet-lineaire methoden
Principal Component Analysis (PCA) is de bekendste lineaire methode: het projecteert data op de richtingen met de meeste variantie. Het is snel en interpreteerbaar, maar werkt minder goed bij niet-lineaire structuren. Linear Discriminant Analysis (LDA) is een supervised alternatief dat klassen scheidt. Niet-lineaire methoden zoals t-SNE en UMAP behouden lokale structuur en zijn populair voor visualisatie. Autoencoders leren een niet-lineaire compressie via neurale netwerken. Kernel PCA past PCA toe in een hogerdimensionale ruimte. Elk van deze methoden heeft hyperparameters die de uitkomst beïnvloeden. Dimensiereductie is daarmee zowel een techniek als een denkkader voor het omgaan met complexe, hoogdimensionale data.