Wat is self supervised learning?

Labels creëren uit de data zelf

Self-supervised learning is een vorm van unsupervised learning waarbij het algoritme zijn eigen labels genereert uit de data. In plaats van externe labels te gebruiken, wordt een pretext-taak gedefinieerd waarbij een deel van de data wordt voorspeld op basis van een ander deel. Een klassiek voorbeeld is het voorspellen van een ontbrekend woord in een zin (masked language modeling), zoals bij BERT. Een ander voorbeeld is het voorspellen van de volgende token in een reeks, zoals bij GPT. In de beeldverwerking worden taken gebruikt zoals het voorspellen van de rotatie van een afbeelding, het invullen van ontbrekende pixels (inpainting) of het onderscheiden van echte en vervormde afbeeldingen. Het idee is dat het model door deze taken zinvolle representaties leert die later kunnen worden gebruikt voor downstream-taken met weinig labels. Self-supervised learning heeft de afgelopen jaren een enorme vlucht genomen, vooral in NLP en computer vision. Het stelt modellen in staat om te leren van enorme hoeveelheden ongelabelde data, wat leidt tot krachtige, generaliseerbare representaties. De uitdaging is het ontwerpen van pretext-taken die nuttige features leren en niet te makkelijk of te moeilijk zijn. Ook is de evaluatie lastig: men meet de kwaliteit vaak via transfer learning naar andere taken.

Voorbeelden en impact

Self-supervised learning heeft geleid tot doorbraken in natuurlijke taalverwerking en computer vision. In NLP zijn modellen zoals BERT, RoBERTa, GPT en T5 vooraf getraind met self-supervised taken op enorme tekstcorpora. BERT gebruikt masked language modeling: 15% van de tokens wordt gemaskeerd en het model moet ze voorspellen. GPT gebruikt causale taalmodellering: voorspel het volgende token. Deze modellen leren rijke representaties die met weinig fine-tuning kunnen worden aangepast aan specifieke taken. In computer vision zijn methoden zoals SimCLR, MoCo en BYOL populair. SimCLR leert representaties door twee augmented versies van dezelfde afbeelding naar elkaar toe te trekken en andere afbeeldingen af te stoten (contrastive learning). BYOL gebruikt geen negatieve paren en leert toch goede representaties. Self-supervised learning wordt ook toegepast in spraakherkenning (wav2vec) en zelfs in de biologie (eiwitstructuurvoorspelling). De impact is groot: het vermindert de afhankelijkheid van dure gelabelde data en maakt het mogelijk om modellen te trainen op vrijwel onbeperkte hoeveelheden ongelabelde data. Het is een van de drijvende krachten achter de huidige AI-revolutie.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.