Text completion vs chatinstruction tuning
Text completion: de basis
Text completion is de oorspronkelijke taak van veel taalmodellen: gegeven een stuk tekst, voorspel het volgende token of de volgende reeks tokens. Modellen zoals GPT-2 en GPT-3 werden in eerste instantie gebruikt voor text completion. De gebruiker geeft een prompt en het model vult aan. Dit kan variëren van het afmaken van een zin tot het genereren van een heel artikel. Text completion is flexibel maar ook onvoorspelbaar: het model heeft geen expliciet begrip van wat de gebruiker wil. Het kan doorgaan in de stijl van de prompt, maar ook afdwalen. Voor taken zoals codegeneratie of creatief schrijven kan text completion goed werken, vooral met een zorgvuldig gekozen prompt. Echter, voor interactieve toepassingen zoals chatbots is het minder geschikt, omdat het model niet goed weet wanneer het moet stoppen of hoe het moet reageren op een vraag. Daarom zijn moderne LLM's vaak niet alleen getraind op text completion, maar ook op instruction tuning en chat-gedrag.
Instruction tuning en chat
Instruction tuning is een fine-tuning-fase waarin een model wordt getraind op datasets met expliciete instructies en bijbehorende antwoorden. Hierdoor leert het model om opdrachten te volgen, zoals 'Vat deze tekst samen' of 'Vertaal dit naar het Frans'. Instruction tuning maakt modellen veel bruikbaarder voor algemene taken, omdat ze niet alleen tekst aanvullen maar ook gericht reageren. Chat-modellen gaan nog een stap verder: ze zijn getraind op multi-turn gesprekken en kunnen context behouden over meerdere beurten. Ze herkennen rollen (system, user, assistant) en zijn vaak afgestemd op veiligheid en behulpzaamheid. Het onderscheid tussen text completion en chat/instruction tuning is belangrijk bij het kiezen van een model. Sommige modellen bieden beide modi aan via verschillende API's. Voor taken zoals het genereren van code of het schrijven van een essay kan text completion prima werken, maar voor klantenservice of persoonlijke assistentie is een chat- of instructiemodel doorgaans beter. Het trainen van een model voor instruction tuning vereist hoogwaardige datasets met diverse instructies en antwoorden, vaak aangevuld met reinforcement learning from human feedback (RLHF) om de kwaliteit en veiligheid te verbeteren.