Wat is over fitting en hoe voorkom je het?
Oorzaken en signalen
Overfitting treedt op wanneer een model de trainingsdata te nauwkeurig benadert, inclusief toevallige patronen en ruis die niet representatief zijn voor de onderliggende relatie. Dit gebeurt vaak bij complexe modellen met veel parameters en relatief weinig trainingsdata. Signalen zijn een lage trainingsfout maar een hoge validatie- of testfout, en een groeiende kloof tussen beide tijdens training. In extreme gevallen memoriseert het model de trainingsdata volledig en presteert het willekeurig op nieuwe voorbeelden. Overfitting is een van de centrale uitdagingen in machine learning, omdat het de betrouwbaarheid van voorspellingen ondermijnt. Het herkennen ervan vereist zorgvuldige monitoring van leercurves en het gebruik van een aparte validatieset.
Technieken om overfitting te voorkomen
Er bestaan diverse technieken om overfitting tegen te gaan. Regularisatie voegt een strafterm toe aan de verliesfunctie, zoals L1 (lasso) of L2 (ridge), waardoor grote gewichten worden ontmoedigd. Dropout zet tijdens training willekeurig neuronen uit, waardoor het netwerk robuuster wordt. Early stopping stopt de training zodra de validatiefout niet meer daalt. Data-augmentatie vergroot de effectieve dataset door transformaties zoals rotatie, scaling of ruis toe te voegen. Ensemble-methoden zoals bagging en boosting combineren meerdere modellen om variantie te reduceren. Cross-validatie geeft een betrouwbaardere schatting van generalisatie. Ten slotte helpt het vereenvoudigen van de modelarchitectuur of het verzamelen van meer data. De juiste balans tussen bias en variantie is hierbij cruciaal.