Temperature top p en top k parameters

Temperatuur en sampling

Bij het genereren van tekst kiest een LLM het volgende token op basis van een waarschijnlijkheidsverdeling. De parameter temperature beïnvloedt deze verdeling. Een lage temperatuur (bijvoorbeeld 0,1) maakt de verdeling scherper, waardoor het model vaker het meest waarschijnlijke token kiest. Dit leidt tot deterministische, voorspelbare output. Een hoge temperatuur (bijvoorbeeld 1,5) vlakt de verdeling af, waardoor minder waarschijnlijke tokens ook een kans krijgen. Dit verhoogt de creativiteit maar ook de kans op onsamenhangende of onjuiste output. Temperature wordt vaak gebruikt in creatieve taken zoals verhalen schrijven, maar is minder geschikt voor feitelijke vraagbeantwoording. Naast temperature zijn er andere sampling-strategieën. Top-K beperkt de keuze tot de K meest waarschijnlijke tokens. Top-P (nucleus sampling) beperkt de keuze tot de kleinste set tokens waarvan de cumulatieve waarschijnlijkheid P overschrijdt. Beide methoden voorkomen dat het model zeer onwaarschijnlijke tokens kiest, terwijl ze toch enige diversiteit behouden. De ideale instelling hangt af van de taak: voor codegeneratie wil je vaak lage temperature en strikte Top-P, voor brainstormen juist hogere waarden.

Praktische richtlijnen

Het kiezen van de juiste parameters is een combinatie van kunst en wetenschap. Voor feitelijke taken zoals vraagbeantwoording, samenvatting en codegeneratie wordt vaak een lage temperatuur (0,0 tot 0,3) gecombineerd met een lage Top-P (0,1 tot 0,5) aanbevolen. Dit minimaliseert hallucinaties en zorgt voor consistente output. Voor creatieve taken zoals het schrijven van verhalen, gedichten of marketingteksten kan een hogere temperatuur (0,7 tot 1,0) met een hogere Top-P (0,9 tot 0,95) zorgen voor verrassende en diverse resultaten. Top-K wordt minder vaak gebruikt in combinatie met Top-P, omdat Top-P adaptiever is. Het is belangrijk om te experimenteren met deze parameters, omdat de optimale waarden per model en per taak verschillen. Sommige API's bieden ook repetition penalties of frequency penalties aan om herhaling tegen te gaan. Het begrijpen van deze parameters is essentieel voor het bouwen van betrouwbare LLM-toepassingen. Verkeerde instellingen kunnen leiden tot saaie, repetitieve output of juist tot onsamenhangende en onbetrouwbare resultaten.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.