Naive bayes classificaties
De stelling van Bayes en de naïeve aanname
Naive Bayes is een familie van probabilistische classificatie-algoritmen die de stelling van Bayes toepassen. De stelling luidt: P(C|X) = P(X|C) * P(C) / P(X), waarbij C de klasse is en X de features. Het algoritme voorspelt de klasse met de hoogste posterior waarschijnlijkheid. De 'naïeve' aanname is dat alle features conditioneel onafhankelijk zijn gegeven de klasse. In de praktijk is dit zelden waar, maar toch presteert Naive Bayes verrassend goed, vooral bij tekstclassificatie. Er zijn verschillende varianten: Gaussian Naive Bayes voor continue features, Multinomial Naive Bayes voor counts (zoals woordfrequenties), en Bernoulli Naive Bayes voor binaire features. Het algoritme is zeer snel, zowel tijdens training als voorspelling. Het vereist weinig data en kan omgaan met hoogdimensionale data. Nadelen zijn de sterke onafhankelijkheidsaanname en de gevoeligheid voor features die niet in de trainingsdata voorkomen (zero-frequency probleem). Dit wordt opgelost met Laplace-smoothing. Naive Bayes wordt veel gebruikt voor spamdetectie, sentimentanalyse en documentclassificatie.
Toepassingen en varianten
Naive Bayes wordt breed toegepast vanwege de eenvoud en snelheid. In e-mailfilters wordt het gebruikt om spam te herkennen op basis van woorden in het bericht. In de geneeskunde kan het helpen bij het voorspellen van ziektes op basis van symptomen, hoewel de onafhankelijkheidsaanname dan vaak problematisch is. In de financiële sector wordt het gebruikt voor het classificeren van transacties als frauduleus of legitiem. Multinomial Naive Bayes is de standaard voor tekstclassificatie, omdat het rekening houdt met de frequentie van woorden. Bernoulli Naive Bayes werkt beter bij korte teksten en binaire features. Gaussian Naive Bayes wordt gebruikt voor continue data, zoals metingen in de natuurkunde of biologie. Het algoritme is ook geschikt voor online learning, omdat het incrementeel kan worden bijgewerkt. Een nadeel is dat de waarschijnlijkheden vaak slecht gekalibreerd zijn: ze zijn niet altijd betrouwbaar als absolute kansen. Voor veel toepassingen is de rangorde echter voldoende. Naive Bayes blijft een populaire baseline en een krachtig hulpmiddel in situaties waar snelheid en eenvoud belangrijk zijn.