Tokenisatie words subwords bpe

Van woord naar subword

Tokenisatie is een fundamentele stap in vrijwel elke NLP-pipeline. Het bepaalt hoe ruwe tekst wordt omgezet in een reeks tokens die als invoer dienen voor een model. De eenvoudigste vorm is woordtokenisatie, waarbij elke token een heel woord is. Dit stuit echter op problemen zoals vocabulary-omvang, woorden die niet in het woordenboek staan (out-of-vocabulary) en morfologische variatie. Subword-tokenisatie biedt een oplossing door woorden op te splitsen in betekenisvolle delen. Hierdoor kan een model bijvoorbeeld 'onwaarschijnlijk' opsplitsen in 'on', 'waar', 'schijn', 'lijk'. Veelgebruikte subword-algoritmen zijn Byte Pair Encoding (BPE), WordPiece en SentencePiece. BPE begint met losse karakters en voegt herhaaldelijk het meest voorkomende paar samen tot een gewenste vocabulary-grootte is bereikt. Hierdoor ontstaat een balans tussen vocabulaire-grootte en de lengte van tokenreeksen. Subword-tokenisatie maakt het mogelijk om zeldzame woorden en zelfs nieuwe samenstellingen te representeren zonder vast te lopen op een gesloten woordenboek. Het is een cruciale techniek voor meertalige modellen, omdat het taaloverstijgend kan werken.

Praktische implicaties en trade-offs

De keuze van tokenisatiemethode heeft directe gevolgen voor modelprestaties, trainingskosten en inferentiesnelheid. Een grotere vocabulary betekent dat veel voorkomende woorden als één token worden weergegeven, wat leidt tot kortere sequenties en dus efficiëntere verwerking. Echter, een grote vocabulary vereist meer parameters in de embedding-laag en kan leiden tot dataschaarste voor zeldzame tokens. Een kleine vocabulary daarentegen produceert langere sequenties, wat de effectieve contextlengte beperkt en de rekenkracht verhoogt. BPE en varianten daarvan zijn de dominante standaard geworden in moderne LLM's. Een belangrijk aandachtspunt is dat tokenisatie taalafhankelijk is: wat voor het Engels efficiënt is, kan voor het Nederlands of Chinees suboptimaal zijn. Sommige modellen gebruiken daarom taal-specifieke tokenizers of een grotere vocabulary om meertalige prestaties te verbeteren. Daarnaast beïnvloedt tokenisatie de manier waarop modellen omgaan met cijfers, leestekens en speciale tekens. Verkeerde tokenisatie kan leiden tot misinterpretatie van getallen of datums. Onderzoek naar tokenizer-vrije modellen en byte-level tokenisatie is gaande, maar subword-tokenisatie blijft voorlopig de norm in de praktijk.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.