Wat is principal component analysis pca?
Wiskundige basis
PCA werkt door de covariantiematrix van de data te berekenen en de eigenwaarden en eigenvectoren te bepalen. De eigenvectoren vormen de hoofdcomponenten; de bijbehorende eigenwaarden geven aan hoeveel variantie elke component verklaart. De data worden geprojecteerd op de eerste paar componenten, waardoor dimensiereductie ontstaat. Meestal worden componenten gekozen die samen een groot deel van de variantie verklaren, bijvoorbeeld 95 procent. PCA is gevoelig voor schaal: variabelen moeten worden gestandaardiseerd voordat PCA wordt toegepast. Het is een van de oudste en meest gebruikte technieken in data-analyse en machine learning. Het is snel, deterministisch en relatief eenvoudig te implementeren.
Toepassingen en beperkingen
PCA wordt gebruikt voor datacompressie, ruisonderdrukking, visualisatie en feature extraction. In beeldverwerking reduceert het de dimensionaliteit van pixeldata; in financiën analyseert het risicofactoren; in genomics identificeert het populatiestructuur. Beperkingen zijn dat PCA alleen lineaire relaties vastlegt en dat componenten vaak moeilijk interpreteerbaar zijn. Ook is PCA gevoelig voor outliers. Voor niet-lineaire data zijn Kernel PCA, t-SNE of UMAP geschikter. PCA gaat ervan uit dat variantie gelijk is aan informatie, wat niet altijd klopt. Desondanks blijft het een waardevolle eerste stap bij exploratie van hoogdimensionale data en een nuttige baseline voor complexere methoden.