Regressiemodellen lineair logistisch

Lineaire regressie

Lineaire regressie is een van de eenvoudigste en meest gebruikte statistische technieken in machine learning. Het model veronderstelt een lineair verband tussen een of meerdere onafhankelijke variabelen (features) en een afhankelijke continue variabele (target). De algemene vorm is y = β0 + β1x1 + β2x2 + ... + βnxn + ε, waarbij β0 het intercept is, βi de coëfficiënten zijn en ε de foutterm. Het doel is om de coëfficiënten te schatten die de som van de gekwadrateerde fouten minimaliseren. Dit wordt ordinary least squares (OLS) genoemd. Lineaire regressie is interpretabel: de coëfficiënten geven aan hoeveel de target verandert als een feature met één eenheid toeneemt, terwijl de andere features constant blijven. Het is echter gevoelig voor uitbijters en gaat uit van lineariteit, onafhankelijkheid van fouten en homoscedasticiteit (constante variantie van fouten). Bij meerdere features kan multicollineariteit optreden, waarbij features gecorreleerd zijn, wat de interpretatie bemoeilijkt. Regularisatietechnieken zoals Ridge (L2) en Lasso (L1) kunnen worden toegepast om overfitting te voorkomen en de coëfficiënten te stabiliseren. Lineaire regressie wordt veel gebruikt in economie, biologie en sociale wetenschappen, maar ook als basis voor complexere modellen.

Logistische regressie

Logistische regressie is een classificatie-algoritme dat de kans voorspelt dat een invoer tot een bepaalde klasse behoort. Ondanks de naam 'regressie' is het een classificatiemethode. Het model past een logistische functie (sigmoid) toe op een lineaire combinatie van features: p = 1 / (1 + e^-(β0 + β1x1 + ... + βnxn)). De uitvoer ligt tussen 0 en 1 en kan worden geïnterpreteerd als een waarschijnlijkheid. Met een drempelwaarde, vaak 0,5, wordt de invoer aan een klasse toegewezen. Logistische regressie wordt veel gebruikt voor binaire classificatie, zoals het voorspellen of een patiënt een ziekte heeft of of een klant een product zal kopen. Het model leert de coëfficiënten door de log-likelihood te maximaliseren, meestal met behulp van iteratieve methoden zoals Newton-Raphson of gradiëntdescent. Het is robuuster tegen uitbijters dan lineaire regressie, maar gaat nog steeds uit van een lineaire beslissingsgrens. Voor niet-lineaire problemen kunnen polynomiale features of kernelmethoden worden toegepast. Logistische regressie is een van de meest gebruikte baseline-modellen vanwege de eenvoud, snelheid en interpreteerbaarheid. De coëfficiënten kunnen worden omgezet in odds ratio's, wat in de geneeskunde en epidemiologie waardevol is. Regularisatie (L1, L2) is ook hier mogelijk om overfitting tegen te gaan.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.