Wat is supervised learning geleerd leren?
Het principe van gelabelde data
Supervised learning, oftewel leren met toezicht, is de meest toegepaste vorm van machine learning. Het kernidee is dat een algoritme een relatie leert tussen invoervariabelen (features) en een uitvoervariabele (label of target). Denk aan een dataset met foto's van huisdieren waarbij elke foto is gelabeld als 'kat' of 'hond'. Het model krijgt tijdens de training beide te zien: de invoer én het correcte antwoord. Het doel is om een functie te vinden die de invoer zo nauwkeurig mogelijk omzet naar de juiste uitvoer. Deze functie wordt geleerd door de fout tussen de voorspelling en het werkelijke label te minimaliseren. Dit gebeurt via een optimalisatieproces, meestal met behulp van gradiëntdescent, waarbij de parameters van het model stapsgewijs worden aangepast. Supervised learning kent twee hoofdvormen: classificatie, waarbij de uitvoer een discrete categorie is (bijvoorbeeld spam of geen spam), en regressie, waarbij de uitvoer een continue waarde is (bijvoorbeeld de prijs van een huis). De kwaliteit van het model hangt sterk af van de hoeveelheid en kwaliteit van de gelabelde data. Overfitting, waarbij het model te veel leert van de trainingsdata en slecht presteert op nieuwe data, is een van de grootste uitdagingen. Daarom wordt data vaak opgesplitst in een trainings-, validatie- en testset. Supervised learning vormt de basis voor talloze toepassingen, van medische diagnose tot fraudedetectie en spraakherkenning.
Classificatie versus regressie
Binnen supervised learning wordt onderscheid gemaakt tussen classificatie en regressie. Bij classificatie is het doel om een invoer toe te wijzen aan een van tevoren gedefinieerde categorieën. Voorbeelden zijn het herkennen van handgeschreven cijfers (0-9), het classificeren van e-mails als spam of legitiem, of het diagnosticeren van een ziekte op basis van medische beelden. De uitvoer is discreet en het model leert beslissingsgrenzen tussen de klassen. Bij regressie is de uitvoer continu. Het model probeert een numerieke waarde te voorspellen, zoals de temperatuur morgen, de omzet van een bedrijf of de prijs van een woning. De prestatiemaatstaven verschillen: bij classificatie gebruikt men vaak accuracy, precisie, recall of F1-score, terwijl bij regressie gemiddelde absolute fout (MAE) of gemiddelde kwadratische fout (MSE) gangbaar zijn. Beide vormen vereisen dat de data representatief is voor het probleem. Een veelvoorkomend probleem is class imbalance, waarbij één klasse veel vaker voorkomt dan een andere. Dit kan leiden tot een model dat de meerderheidsklasse bevoordeelt. Technieken zoals oversampling, undersampling of het gebruik van gewichtsfactoren kunnen dit mitigeren. Daarnaast is het belangrijk om de data te normaliseren of te standaardiseren, vooral bij algoritmen die gevoelig zijn voor de schaal van features, zoals SVM en KNN. Supervised learning blijft zich ontwikkelen, met nieuwe algoritmen en technieken die steeds betere prestaties leveren op complexe taken.