Random forests
Het algoritme achter Random Forests
Random Forest is een supervised learning-algoritme dat behoort tot de familie van ensemble-methoden. Het bouwt een groot aantal beslissingsbomen tijdens de training en combineert hun uitkomsten. Het idee is dat een groep zwakke lerers samen een sterk lerer vormt. Elke boom wordt getraind op een bootstrap-sample van de data: een willekeurige steekproef met teruglegging. Daarnaast wordt bij elke splitsing in de boom een willekeurige subset van features overwogen. Dit introduceert diversiteit tussen de bomen en vermindert de correlatie. Voor classificatie wordt de uiteindelijke voorspelling bepaald door meerderheidsstemming; voor regressie door het gemiddelde van de voorspellingen. Deze aanpak verlaagt de variantie aanzienlijk zonder de bias veel te verhogen. Random Forest is robuust tegen overfitting, mits het aantal bomen groot genoeg is. Het algoritme is ook paralleliseerbaar, wat de trainingstijd ten goede komt. Het kan omgaan met hoogdimensionale data en geeft een indicatie van feature-importance, wat nuttig is voor inzicht. Nadelen zijn de beperkte interpreteerbaarheid (het is een black box-achtig model) en de grotere rekenkracht die nodig is. Desondanks is Random Forest een van de meest gebruikte algoritmen in de praktijk, vanwege de balans tussen nauwkeurigheid, robuustheid en gebruiksgemak.
Praktische toepassingen en afwegingen
Random Forests worden breed toegepast in uiteenlopende domeinen. In de geneeskunde helpen ze bij het voorspellen van ziekteprogressie op basis van genetische en klinische data. In de financiële sector worden ze gebruikt voor kredietrisicoanalyse en fraudedetectie. In de e-commerce voorspellen ze of een klant een product zal kopen of zal afhaken. Ook in de biologie, astronomie en milieuwetenschappen zijn ze populair. Een belangrijk voordeel is dat Random Forest weinig hyperparameter-tuning vereist. Het aantal bomen (n_estimators) en de maximale diepte zijn de belangrijkste parameters. Meer bomen leiden zelden tot overfitting, maar verhogen de rekentijd. De out-of-bag (OOB) error is een handige interne validatiemethode die geen aparte validatieset vereist. Random Forest kan ook omgaan met missende waarden door middel van imputatie, hoewel dit de resultaten kan beïnvloeden. Een nadeel is dat het model moeilijk te interpreteren is: men kan niet eenvoudig zien welke regels tot een voorspelling leiden. Voor verklarende toepassingen verkiest men soms een enkele boom of een lineair model. Niettemin blijft Random Forest een uitstekende keuze voor wie een krachtig, betrouwbaar model nodig heeft zonder al te veel zorgen over overfitting.