Model monitoring data drift vs concept drift
Data drift
Data drift (ook wel feature drift of covariate shift genoemd) treedt op wanneer de verdeling van de invoerdata verandert ten opzichte van de data waarop het model is getraind. Een model dat is getraind op klantgegevens uit 2023 kan in 2025 te maken krijgen met andere demografische patronen of gedragingen. Het model zelf is niet verkeerd, maar de wereld om hem heen is veranderd. Data drift kan worden gedetecteerd door statistische tests op feature-distributies, zoals het vergelijken van gemiddelden, varianties of histogrammen. Als de invoerdata significant afwijkt van de trainingsdata, is hertraining of aanpassing nodig.
Concept drift
Concept drift is subtieler: de relatie tussen invoer en uitvoer verandert. Bijvoorbeeld: een model dat spam detecteert op basis van bepaalde woorden, kan falen als spammers hun taalgebruik aanpassen. De invoerdata kan er hetzelfde uitzien, maar de betekenis is veranderd. Concept drift wordt gedetecteerd door de modelprestaties in de gaten te houden: als de nauwkeurigheid daalt terwijl de invoerdata niet significant is veranderd, is er waarschijnlijk sprake van concept drift [citation:15]. Het onderscheiden van data drift en concept drift is belangrijk omdat de aanpak verschilt: bij data drift kan het model worden aangepast aan de nieuwe distributie, bij concept drift is vaak een nieuw model nodig dat de nieuwe relatie leert.