Llm evaluation metrics bleu rouge perplexity

BLEU en ROUGE

BLEU (Bilingual Evaluation Understudy) is een metriek voor machinevertaling. Het meet de overlap van n-grams tussen de gegenereerde vertaling en een of meer referentievertalingen. Een hogere BLEU-score betekent meer overlap en wordt vaak geassocieerd met betere kwaliteit. BLEU is snel en breed gebruikt, maar heeft beperkingen: het houdt geen rekening met betekenis, synoniemen of woordvolgorde. ROUGE (Recall-Oriented Understudy for Gisting Evaluation) is een familie van metrieken voor samenvatting. ROUGE-N meet de overlap van n-grams, ROUGE-L meet de langste gemeenschappelijke deelsequentie. ROUGE wordt veel gebruikt bij tekstsamenvatting en vraagbeantwoording. Net als BLEU is het gebaseerd op oppervlakkige overeenkomst en correleert het niet altijd met menselijke beoordeling. Desondanks zijn het nuttige en snelle indicatoren voor modelvergelijking.

Perplexity en andere metrieken

Perplexity is een metriek die meet hoe goed een taal模型 een tekst kan voorspellen. Het is de exponentiële van de cross-entropie. Een lagere perplexity betekent dat het model de tekst beter voorspelt. Perplexity wordt vaak gebruikt tijdens training om de convergentie te volgen. Het is echter niet direct een maat voor de kwaliteit van gegenereerde tekst; een model kan lage perplexity hebben maar saaie of repetitieve output produceren. Andere metrieken zijn METEOR, TER en BERTScore. BERTScore gebruikt contextuele embeddings om de semantische gelijkenis tussen gegenereerde en referentietekst te meten. Het correleert beter met menselijke beoordeling dan BLEU en ROUGE. Voor het evalueren van LLM's is het belangrijk om meerdere metrieken te combineren en waar mogelijk menselijke evaluatie te gebruiken. Elke metriek heeft sterke en zwakke punten, en de keuze hangt af van de taak en het doel van de evaluatie.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.