Hierarchische clustering
Agressief en divisief clusteren
Hiërarchische clustering is een familie van clusteralgoritmen die een hiërarchische structuur van clusters creëert. Er zijn twee hoofdvarianten: agglomeratief en divisief. Agglomeratief clusteren begint met elk datapunt als een apart cluster en voegt stap voor stap de dichtstbijzijnde clusters samen. Divisief clusteren begint met één cluster en splitst dit herhaaldelijk op. Agglomeratief clusteren is het meest gebruikelijk. Het resultaat wordt weergegeven als een dendrogram: een boomdiagram dat de samenvoegingen toont. Door de dendrogram op een bepaald niveau af te snijden, ontstaat een clustering. Dit maakt het mogelijk om het aantal clusters achteraf te bepalen. De keuze van de afstandsmaat en de linkage-methode is cruciaal. Linkage bepaalt hoe de afstand tussen clusters wordt berekend: single linkage (dichtstbijzijnde punten), complete linkage (verst verwijderde punten), average linkage (gemiddelde afstand) of Ward's methode (minimaliseert variantie). Ward's methode levert vaak compacte, bolvormige clusters op. Hiërarchische clustering is rekenintensief: de complexiteit is minimaal O(n^2), wat het ongeschikt maakt voor zeer grote datasets. Het is ook gevoelig voor ruis en uitbijters. Voordelen zijn de interpreteerbaarheid en het feit dat er geen vooraf gekozen aantal clusters nodig is.
Toepassingen en beperkingen
Hiërarchische clustering wordt gebruikt in de bio-informatica voor het groeperen van genen met vergelijkbare expressiepatronen, in de sociale wetenschappen voor het identificeren van subgroepen, en in de marktanalyse voor klantsegmentatie. Het is ook nuttig bij het analyseren van documenten of afbeeldingen. Een groot voordeel is de dendrogram-visualisatie, die inzicht geeft in de relaties tussen clusters op verschillende niveaus. Dit maakt het een exploratief hulpmiddel bij uitstek. Beperkingen zijn de hoge rekenkosten en de gevoeligheid voor de gekozen linkage-methode. Single linkage kan last hebben van chaining, waarbij clusters langwerpig worden; complete linkage kan kleine, compacte clusters forceren. Average linkage is een compromis. Een andere uitdaging is het omgaan met ontbrekende data. In de praktijk wordt hiërarchische clustering vaak gecombineerd met andere methoden, zoals het gebruik van een afstandsmatrix die vooraf is berekend. Voor grote datasets zijn benaderende methoden zoals BIRCH ontwikkeld, die eerst een samenvatting maken en daarop hiërarchisch clusteren. Ondanks de beperkingen blijft hiërarchische clustering waardevol voor exploratieve analyse en situaties waarin de hiërarchie zelf belangrijk is.