Wat is een activatiefunctie relu sigmoid softmax?
Waarom niet-lineariteit nodig is
Zonder activatiefuncties zou een neuraal netwerk, ongeacht het aantal lagen, equivalente zijn aan een lineaire transformatie. Niet-lineariteit stelt het netwerk in staat niet-lineaire beslissingsgrenzen en complexe functies te benaderen. De activatiefunctie wordt toegepast op de gewogen som van inputs plus bias. Verschillende functies hebben verschillende eigenschappen met betrekking tot differentieerbaarheid, verzadiging en rekenkosten. De keuze beïnvloedt de trainingssnelheid en stabiliteit. In de outputlaag bepaalt de activatiefunctie het type voorspelling: sigmoid voor binaire classificatie, softmax voor multiclass, lineair voor regressie.
Veelgebruikte activatiefuncties
Sigmoid zet waarden om naar (0,1) en is geschikt voor binaire classificatie, maar verzadigt bij extreme waarden, wat leidt tot verdwijnende gradiënten. Tanh zet waarden om naar (-1,1) en is gecentreerd rond nul, wat convergentie kan versnellen. ReLU (Rectified Linear Unit) is de standaard in verborgen lagen: het is eenvoudig, snel en vermijdt verzadiging voor positieve waarden. Het nadeel is dat neuronen kunnen 'sterven' bij negatieve inputs. Varianten zoals Leaky ReLU, ELU en GELU ondervangen dit. Softmax wordt gebruikt in de outputlaag voor multiclass-classificatie en zet een vector om naar een kansverdeling. De juiste keuze van activatiefuncties is een belangrijk onderdeel van architectuurontwerp.