Wat is een vector representatie?
Van data naar vectoren
Computers kunnen niet direct werken met ruwe data zoals tekst, afbeeldingen of audio. Deze moeten worden omgezet naar vectoren: geordende lijsten van getallen. Een afbeelding wordt bijvoorbeeld een vector van pixelwaarden; een woord wordt een vector van embedding-waarden. Vectorrepresentaties maken wiskundige bewerkingen mogelijk zoals optellen, vermenigvuldigen en het berekenen van afstanden. In machine learning is de input voor vrijwel elk model een vector. De dimensionaliteit kan variëren van enkele tientallen tot duizenden. Een goede vectorrepresentatie behoudt relevante informatie en laat irrelevante details weg. Dit proces van vectorisatie is een fundamentele stap in elke AI-pijplijn.
Vectorruimte en gelijkenis
In een vectorruimte kunnen gelijkenissen tussen datapunten worden gemeten met metrieken zoals euclidische afstand, cosinusgelijkenis of dotproduct. Dit maakt het mogelijk om clustering, classificatie en zoeken uit te voeren. Woordembeddings zoals Word2Vec en GloVe plaatsen semantisch vergelijkbare woorden dicht bij elkaar. Contextuele embeddings zoals BERT en GPT maken vectoren die afhangen van de zin waarin een woord voorkomt. Voor afbeeldingen leren CNN's vectoren die visuele kenmerken vastleggen. Vectorrepresentaties zijn ook de basis van vector databases, die gebruikt worden voor similarity search en recommendation systems. Het concept is daarmee centraal in moderne AI, van zoekmachines tot generatieve modellen.