Zero shot learning
Leren zonder voorbeelden
Zero-shot learning (ZSL) is een paradigma waarbij een model in staat is om een taak uit te voeren zonder dat het tijdens de training expliciete voorbeelden van die taak heeft gezien. Dit klinkt tegenstrijdig, maar het is mogelijk dankzij de overdracht van kennis uit gerelateerde taken en het gebruik van semantische representaties. Een klassiek voorbeeld is een model dat is getraind om katten en honden te herkennen, en vervolgens een zebra correct classificeert op basis van een tekstuele beschrijving of attributen zoals 'gestreept' en 'viervoetig'. In de taalverwerking betekent zero-shot dat een model een taak uitvoert op basis van een instructie, zonder dat het ooit specifiek op die taak is getraind. Grote taalmodellen zoals GPT-4 kunnen bijvoorbeeld een samenvatting maken of een vraag beantwoorden zonder fine-tuning, simpelweg door de prompt. Dit vermogen komt voort uit de enorme hoeveelheid data en de diversiteit aan taken die tijdens de pre-training zijn gezien. Zero-shot learning is krachtig omdat het de noodzaak van taakspecifieke data wegneemt. Het is echter niet feilloos: de prestaties zijn vaak minder goed dan bij modellen die wel zijn getraind op de specifieke taak. De grenzen van zero-shot learning zijn een actief onderzoeksgebied.
Toepassingen en uitdagingen
Zero-shot learning wordt breed toegepast in beeldclassificatie, tekstclassificatie, objectdetectie en zelfs spraakherkenning. In de computer vision worden attributen gebruikt om objecten te beschrijven die niet in de trainingsdata voorkomen. Een model leert bijvoorbeeld dat een 'roodborstje' een 'vogel' is met een 'rode borst', en kan zo een nieuw vogelsoort herkennen op basis van die kenmerken. In NLP wordt zero-shot classification gebruikt om teksten te categoriseren zonder labels, door gebruik te maken van een natural language inference-model. Het model krijgt de tekst en een mogelijke categorie, en voorspelt of de tekst bij de categorie past. Zero-shot learning kent uitdagingen. Het model kan last hebben van de semantische kloof: de relatie tussen visuele kenmerken en tekstuele beschrijvingen is niet altijd eenduidig. Ook kan het model bevooroordeeld zijn richting klassen die het wel heeft gezien. Bovendien is de evaluatie lastig: men moet testen op klassen die niet in de training voorkomen. Desondanks is zero-shot learning een van de meest veelbelovende richtingen in AI, omdat het modellen flexibeler en breder inzetbaar maakt.