Wat is een feature kenmerk in data?
Features als inputvariabelen
In machine learning is een feature een individuele, meetbare eigenschap van een datapunt. Bij een model dat huizenprijzen voorspelt, kunnen features zijn: oppervlakte, aantal kamers, postcode en bouwjaar. Bij beeldherkenning zijn features aanvankelijk pixels, maar deep learning leert hiërarchische features: randen, texturen, delen en uiteindelijk objecten. De keuze en kwaliteit van features zijn vaak bepalend voor modelprestaties. Feature engineering, het handmatig creëren en selecteren van relevante features, was traditioneel een kernactiviteit. Tegenwoordig leren neurale netwerken features automatisch, maar bij tabulaire data blijft feature engineering belangrijk. Features kunnen numeriek, categorisch, ordinaal of tekstueel zijn, en vereisen verschillende voorverwerkingsstappen zoals normalisatie, one-hot encoding of tokenisatie.
Selectie, constructie en dimensionaliteit
Niet elke feature is nuttig; irrelevante of redundante features kunnen ruis toevoegen en overfitting bevorderen. Feature selectie-methoden zoals filter-, wrapper- en embedded-methoden helpen om de meest informatieve features te kiezen. Feature constructie creëert nieuwe features uit bestaande, bijvoorbeeld het berekenen van de verhouding tussen inkomen en schuld. Het aantal features bepaalt de dimensionaliteit van de data: bij veel features ontstaat de curse of dimensionality, waarbij datapunten steeds verder van elkaar komen te liggen en modellen moeilijker generaliseren. Dimensionaliteitsreductietechnieken zoals PCA en t-SNE verkleinen het aantal features met behoud van essentiële informatie. Het begrijpen van features is ook belangrijk voor uitlegbaarheid: door te analyseren welke features het meeste bijdragen aan voorspellingen, kunnen modellen transparanter en eerlijker worden gemaakt.