Wat zijn parameters en hyperparameters?
Parameters: geleerd uit data
Parameters zijn de interne variabelen van een model die tijdens training worden aangepast om de fout te minimaliseren. Bij een lineair model zijn dat de coëfficiënten en het intercept; bij een neuraal netwerk zijn het de gewichten en biases van elke verbinding. Het aantal parameters kan variëren van enkele tientallen bij eenvoudige modellen tot honderden miljarden bij grote taalmodellen. Parameters worden bijgewerkt via optimalisatie-algoritmen zoals gradient descent, op basis van de gradiënt van de verliesfunctie. Ze worden opgeslagen in het modelbestand en vormen samen de 'kennis' van het model. Het aantal parameters is een maat voor de capaciteit van het model: te veel parameters kan leiden tot overfitting, te weinig tot underfitting. Regularisatietechnieken zoals L1, L2 en dropout helpen om het aantal effectieve parameters te beperken.
Hyperparameters: vooraf gekozen
Hyperparameters zijn instellingen die niet uit data worden geleerd, maar vooraf door de ontwikkelaar worden gekozen. Voorbeelden zijn leersnelheid, batchgrootte, aantal epochs, aantal lagen, aantal neuronen per laag, regularisatiesterkte en keuze van activatiefunctie. Ze beïnvloeden hoe het model leert en hoe goed het generaliseert. Het vinden van optimale hyperparameters gebeurt via grid search, random search of Bayesian optimization. Bij deep learning kan dit rekenintensief zijn, waardoor technieken zoals early stopping en learning rate scheduling worden ingezet. Hyperparameters zijn dus meta-keuzes: ze sturen het leerproces zonder zelf deel uit te maken van het geleerde model. Een verkeerde keuze kan leiden tot trage convergentie, oscillatie of slechte prestaties, zelfs bij een uitstekende architectuur.