Model distillation kennisoverdracht van groot naar klein model
Werking van distillation
Model distillation is een techniek waarbij een groot, complex model (de teacher) wordt gebruikt om een kleiner model (de student) te trainen. De student leert niet alleen van de harde labels (de juiste antwoorden), maar ook van de zachte voorspellingen van de teacher. Deze zachte voorspellingen bevatten meer informatie dan alleen het juiste label: ze geven aan hoe waarschijnlijk het model andere klassen acht. Hierdoor kan de student beter generaliseren dan wanneer hij alleen op de harde labels zou worden getraind. Distillation wordt gebruikt om grote modellen zoals BERT of GPT te comprimeren tot modellen die op edge-apparaten kunnen draaien, zonder al te veel kwaliteitsverlies.
Toepassingen en voordelen
Distillation wordt veel gebruikt in natuurlijke taalverwerking en computer vision. Het maakt het mogelijk om de kennis van een groot model over te dragen naar een kleiner model dat sneller en zuiniger is. Dit is essentieel voor realtime toepassingen en edge AI. Distillation kan ook worden gecombineerd met andere technieken zoals kwantisatie en pruning. Een uitdaging is dat de student niet altijd alle nuances van de teacher kan leren, vooral bij zeer complexe taken. Desondanks is distillation een krachtige methode om AI toegankelijker en efficiënter te maken.