Wat is een large language model llm?

Architectuur en training

Large Language Models (LLM's) zijn doorgaans gebaseerd op de transformer-architectuur, die in 2017 werd geïntroduceerd in het paper 'Attention is All You Need'. De kern van een transformer is het self-attention-mechanisme, waarmee het model relaties kan leggen tussen alle woorden in een sequentie, ongeacht de afstand. Een LLM bestaat uit vele lagen van attention- en feedforward-netwerken, met miljarden of zelfs honderden miljarden parameters. Training gebeurt in twee fasen: pre-training en fine-tuning. Tijdens pre-training leert het model taalpatronen door eenvoudige doelen zoals het voorspellen van het volgende woord in een zin. Dit gebeurt op enorme datasets met honderden miljarden tokens, vaak afkomstig van het internet, boeken en code. Na pre-training volgt vaak fine-tuning op specifieke taken of instructies, waardoor het model bruikbaar wordt voor chat, vertaling, samenvatting en meer. De schaal van LLM's is cruciaal: grotere modellen blijken beter te presteren op een breed scala aan taken, een fenomeen dat scaling laws wordt genoemd. Dit heeft geleid tot een race naar steeds grotere modellen, al verschuift de focus nu ook naar efficiëntie en kleinere, gespecialiseerde modellen.

Mogelijkheden en beperkingen

LLM's kunnen indrukwekkende prestaties leveren op taken zoals tekstgeneratie, vertaling, samenvatting, vraagbeantwoording en codegeneratie. Ze zijn in staat om zero-shot of few-shot te leren: met enkele voorbeelden in de prompt kunnen ze nieuwe taken uitvoeren zonder expliciete training. Dit maakt ze flexibel en breed inzetbaar. Echter, LLM's hebben ook belangrijke beperkingen. Ze hebben geen echt begrip van de wereld; ze leren statistische patronen uit tekst. Hierdoor kunnen ze fouten maken, biases reproduceren en hallucineren: plausibel klinkende maar onjuiste informatie genereren. Daarnaast zijn ze afhankelijk van hun trainingsdata, die een afsluitdatum heeft, waardoor ze geen actuele informatie kennen tenzij ze toegang krijgen tot externe bronnen. De context window is beperkt, wat betekent dat ze niet willekeurig lange teksten kunnen verwerken. Ook zijn LLM's rekenintensief en duur om te trainen en te draaien. Milieu-impact en ethische vraagstukken rondom dataverzameling en gebruik zijn dan ook onderwerp van discussie. Desondanks vormen LLM's een krachtige basis voor talloze AI-toepassingen en blijven ze zich snel ontwikkelen.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.