Wat is active learning?

Slim kiezen welke data je labelt

Active learning is een vorm van machine learning waarbij het algoritme actief de datapunten selecteert die het meest nuttig zijn om te labelen. In plaats van willekeurig data te labelen, kiest het model de voorbeelden waarover het het meest onzeker is, of die het meest representatief zijn voor de datadistributie. Dit vermindert de hoeveelheid gelabelde data die nodig is om een goed model te trainen. Active learning is vooral waardevol wanneer labeling duur of tijdrovend is, zoals in medische beeldvorming, waar een expert nodig is om beelden te annoteren. Het proces verloopt iteratief: eerst wordt een model getraind op een kleine set gelabelde data. Vervolgens selecteert het model een set ongelabelde datapunten op basis van een selectiestrategie. Deze worden door een menselijke expert gelabeld en toegevoegd aan de trainingsset. Het model wordt opnieuw getraind en de cyclus herhaalt zich. Er zijn verschillende selectiestrategieën: uncertainty sampling (kies de punten waar het model het minst zeker over is), query by committee (meerdere modellen stemmen en de punten met de meeste onenigheid worden gekozen), en expected model change (kies de punten die het model het meest zouden veranderen). Active learning kan de labelkosten aanzienlijk verlagen, soms met een factor tien of meer.

Uitdagingen en toepassingen

Active learning kent verschillende uitdagingen. Het selecteren van de juiste datapunten is niet triviaal. Uncertainty sampling kan leiden tot het selecteren van uitbijters, wat niet altijd nuttig is. Het kan ook leiden tot een bias naar bepaalde klassen. Een andere uitdaging is de koude start: het initiële model moet al redelijk zijn om goede selecties te maken. Als het model te slecht is, worden de verkeerde punten gekozen. Ook is het niet altijd duidelijk of de geselecteerde punten daadwerkelijk informatiever zijn dan willekeurige punten. In de praktijk wordt active learning vaak gecombineerd met semi-supervised learning en transfer learning. Toepassingen zijn te vinden in de geneeskunde (het selecteren van de meest informatieve patiëntscans), in de astronomie (het classificeren van sterrenstelsels), in de materiaalkunde (het ontdekken van nieuwe materialen) en in de NLP (het annoteren van tekst voor zeldzame talen). Active learning is vooral nuttig wanneer de kosten van labeling hoog zijn en de hoeveelheid ongelabelde data groot is. Het is een van de meest praktische manieren om met beperkte middelen toch goede modellen te bouwen.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.