Catastrophic forgetting in neurale netwerken
Het probleem van overschrijven
Catastrophic forgetting, ook wel catastrofaal vergeten genoemd, is een van de grootste uitdagingen in continual learning. Het treedt op wanneer een neuraal netwerk wordt getraind op een nieuwe taak en daarbij de gewichten aanpast die belangrijk waren voor eerdere taken. Omdat neurale netwerken hun kennis distribueren over vele gewichten, kan het aanpassen van die gewichten voor een nieuwe taak de oude kennis verstoren. Dit is een fundamenteel probleem: het netwerk heeft geen mechanisme om te weten welke gewichten belangrijk zijn voor welke taak. Catastrophic forgetting is voor het eerst beschreven in de jaren 80 en is nog steeds een actief onderzoeksgebied. Het probleem wordt verergerd door het feit dat taken vaak sequentieel worden aangeboden, zonder dat de oude data beschikbaar is. Dit wordt ook wel 'task-incremental learning' genoemd. Bij 'class-incremental learning' worden nieuwe klassen toegevoegd zonder dat de oude klassen opnieuw worden aangeboden. Het gevolg is dat het model de oude klassen niet meer herkent. Catastrophic forgetting is een van de redenen waarom het trainen van AI-systemen vaak in één keer gebeurt, in plaats van incrementeel.
Oplossingen en onderzoek
Er zijn verschillende strategieën om catastrofaal vergeten tegen te gaan. Regularisatiemethoden zoals Elastic Weight Consolidation (EWC) berekenen de importantie van elk gewicht voor eerdere taken en voegen een straf toe voor het veranderen ervan. Synaptic Intelligence (SI) en Memory Aware Synapses (MAS) zijn vergelijkbare methoden. Replay-methoden slaan een subset van oude data op en trainen het model op een mix van oude en nieuwe data. Dit kan ook met gegenereerde data (generative replay), waarbij een generatief model oude data nabootst. Architectuurmethoden breiden het netwerk uit met nieuwe modules voor nieuwe taken, zoals Progressive Neural Networks en Dynamically Expandable Networks. Parameter-isolatiemethoden zoals PackNet wijzen specifieke gewichten toe aan specifieke taken. Meta-learning benaderingen leren een model dat snel nieuwe taken kan leren zonder oude te vergeten. Ondanks deze oplossingen is catastrofaal vergeten nog niet volledig opgelost. Het blijft een van de grootste obstakels voor het bouwen van AI-systemen die continu kunnen leren, zoals robots en persoonlijke assistenten.