Word embeddings word2vec glove

Word2vec en GloVe

Word embeddings zijn een doorbraak in NLP omdat ze woorden representeren als continue vectoren in een hoogdimensionale ruimte. Hierdoor kunnen modellen semantische en syntactische relaties leren. Word2vec, geïntroduceerd door Google in 2013, gebruikt een ondiep neuraal netwerk om woorden te voorspellen op basis van context (Continuous Bag-of-Words) of context op basis van een woord (Skip-gram). Het resultaat is dat woorden met vergelijkbare betekenissen dicht bij elkaar in de vectorruimte liggen. Een beroemd voorbeeld is dat de vector voor 'koning' min 'man' plus 'vrouw' dicht bij 'koningin' ligt. GloVe (Global Vectors), ontwikkeld door Stanford, combineert globale co-occurrence-statistieken met lokale contextvensters. Het produceert vergelijkbare embedding-ruimtes als Word2vec maar met een andere trainingsmethode. Beide methoden leveren statische embeddings: elk woord heeft één vector, ongeacht context. Dit is een beperking, want woorden kunnen meerdere betekenissen hebben (polysemie). Desondanks zijn Word2vec en GloVe nog steeds nuttig voor veel taken en dienen ze als basis voor meer geavanceerde contextuele embeddings zoals ELMo en BERT.

Contextuele embeddings en beperkingen

Statische embeddings zoals Word2vec en GloVe kennen aan elk woord één vaste vector toe. Dit betekent dat het woord 'bank' dezelfde representatie heeft in 'ik zit op de bank' en 'ik ga naar de bank'. Contextuele embeddings lossen dit op door de vector van een woord afhankelijk te maken van de omringende woorden. Modellen zoals ELMo, BERT en GPT genereren dynamische representaties die per gebruikssituatie verschillen. Hierdoor kunnen ze beter omgaan met polysemie, synoniemen en idiomatische uitdrukkingen. Contextuele embeddings presteren doorgaans beter op vrijwel alle NLP-taken, maar ze zijn ook rekenintensiever en vereisen meer data. Statische embeddings hebben nog steeds voordelen: ze zijn snel, lichtgewicht en gemakkelijk te gebruiken in omgevingen met beperkte middelen. Ze worden ook vaak gebruikt als input voor eenvoudigere modellen of als onderdeel van een grotere pijplijn. Een andere beperking van zowel statische als contextuele embeddings is dat ze bias kunnen bevatten die aanwezig is in de trainingsdata. Dit kan leiden tot stereotypes en oneerlijke voorspellingen. Onderzoek naar debiasing en eerlijke representaties is dan ook een actief gebied binnen NLP.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.