Wat is semi supervised learning?

Het midden tussen supervised en unsupervised

Semi-supervised learning is een hybride vorm van machine learning die zowel gelabelde als ongelabelde data gebruikt. In veel praktijksituaties is het verzamelen van labels duur, tijdrovend of vereist het expertise. Ongelabelde data is daarentegen vaak overvloedig aanwezig. Semi-supervised learning probeert deze situatie te benutten door de structuur in de ongelabelde data te gebruiken om de beslissingsgrens te verfijnen. Enkele veelgebruikte technieken zijn self-training, waarbij een model eerst op de gelabelde data wordt getraind en vervolgens zijn eigen voorspellingen op ongelabelde data als pseudo-labels gebruikt; co-training, waarbij meerdere modellen op verschillende feature-subsets worden getraind en elkaar aanvullen; en graph-based methoden, waarbij datapunten als knopen in een graaf worden voorgesteld en labels zich verspreiden via de randen. Semi-supervised learning is bijzonder effectief wanneer de ongelabelde data dezelfde verdeling volgt als de gelabelde data. Het kan de nauwkeurigheid aanzienlijk verbeteren ten opzichte van supervised learning met alleen de gelabelde data. Risico's zijn confirmation bias (het model versterkt zijn eigen fouten) en het feit dat de aannames over de datastructuur moeten kloppen. Het wordt veel gebruikt in beeldclassificatie, tekstclassificatie en spraakherkenning.

Technieken en uitdagingen

Er bestaan diverse technieken voor semi-supervised learning. Self-training is de eenvoudigste: train een model, voorspel labels voor ongelabelde data, voeg de meest zekere voorspellingen toe aan de trainingsset en herhaal. Dit kan echter fouten versterken. Co-training splitst de features in twee onafhankelijke sets en traint twee modellen die elkaars meest zekere voorspellingen toevoegen. Graph-based methoden bouwen een graaf waarin datapunten verbonden zijn op basis van overeenkomst; labels worden gepropageerd via de graaf. Generative models zoals Gaussian Mixture Models kunnen ongelabelde data gebruiken om de datadistributie beter te schatten. Recente ontwikkelingen in deep learning combineren semi-supervised learning met consistency regularization: het model moet dezelfde voorspelling geven voor een datapunt en een licht verstoorde versie ervan. Voorbeelden zijn MixMatch en FixMatch. Uitdagingen zijn het bepalen van de betrouwbaarheid van pseudo-labels, het vermijden van confirmation bias en het omgaan met scheve klassenverdelingen. Ook is het moeilijk om te weten wanneer ongelabelde data nuttig is en wanneer niet. Semi-supervised learning is vooral waardevol in domeinen waar labels schaars zijn, zoals medische beeldvorming, waar het aantal gelabelde scans beperkt is maar ongelabelde scans overvloedig zijn.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.