Wat is een embedding?

Embeddings in NLP

In natural language processing worden woorden, zinnen of documenten omgezet in embeddings. Vroege methoden zoals Word2Vec en GloVe leren statische embeddings op basis van co-occurrence in grote tekstcorpora. Moderne modellen zoals BERT en GPT produceren contextuele embeddings, waarbij de vector van een woord afhangt van de omringende context. Hierdoor kunnen polysemen zoals 'bank' (financieel vs. zitmeubel) correct worden onderscheiden. Embeddings maken het mogelijk om semantische zoekopdrachten uit te voeren, zoals het vinden van vergelijkbare documenten of het beantwoorden van vragen. Ze worden ook gebruikt in aanbevelingssystemen, waar gebruikers en items in dezelfde ruimte worden geplaatst.

Embeddings buiten NLP

Embeddings zijn niet beperkt tot tekst. In computer vision leren CNN's embeddings van afbeeldingen die gebruikt worden voor gezichtsherkenning, beeldzoekopdrachten en medische diagnostiek. In recommendation systems worden gebruikers en producten geëmbed in een gedeelde ruimte, zodat voorkeuren kunnen worden voorspeld. In graph learning worden nodes geëmbed op basis van hun positie en relaties in een netwerk. Embeddings worden ook gebruikt voor tabulaire data, audio en multimodaliteit, waarbij tekst, beeld en geluid in een gemeenschappelijke ruimte worden gebracht. Het trainen van goede embeddings vereist vaak grote datasets en contrastieve leerdoelen. Embeddings zijn daarmee een van de meest veelzijdige concepten in moderne AI.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.