Hoe leren kunstmatige neuronen perceptrons?
De perceptron-leerregel
Een perceptron ontvangt meerdere inputs x₁, x₂, ..., xₙ, vermenigvuldigt deze met gewichten w₁, w₂, ..., wₙ, telt een bias b op en past een activatiefunctie toe. De uitvoer is 1 of 0, afhankelijk van of de gewogen som een drempel overschrijdt. Tijdens training wordt voor elk voorbeeld de voorspelling vergeleken met het werkelijke label. Bij een fout worden de gewichten aangepast volgens de regel wᵢ ← wᵢ + η(y - ŷ)xᵢ, waarbij η de leersnelheid is. Dit proces herhaalt zich tot het model convergeert of een maximum aantal epochs is bereikt. De perceptron-convergentiestelling garandeert convergentie voor lineair scheidbare data. Voor niet-lineair scheidbare problemen, zoals XOR, faalt een enkel perceptron; meer lagen zijn dan nodig.
Van perceptron naar meerlaagse netwerken
Een enkel perceptron kan alleen lineaire beslissingsgrenzen leren. Door meerdere perceptrons in lagen te stapelen ontstaat een multilayer perceptron (MLP), die niet-lineaire relaties kan modelleren. Elke neuron in een verborgen laag leert een andere combinatie van inputs, waardoor complexe representaties ontstaan. Het leerproces in een MLP verloopt via backpropagation: de fout wordt van de outputlaag terug naar de inputlaag gepropageerd, en gewichten worden bijgewerkt met gradient descent. Activatiefuncties zoals ReLU, sigmoid en tanh introduceren niet-lineariteit, essentieel voor het leren van complexe patronen. Moderne varianten zoals LSTMs, GRU's en transformers bouwen voort op dit principe. Het begrijpen van het perceptron is daarmee de basis voor het begrijpen van alle deep learning-architecturen.