Q learning uitgelegd

De Q-functie en de Bellman-vergelijking

Q-learning is een van de bekendste reinforcement learning-algoritmen. Het leert een Q-functie Q(s, a) die de verwachte cumulatieve beloning schat voor het nemen van actie a in toestand s, en daarna het optimale beleid te volgen. Het algoritme is modelvrij: het heeft geen model van de omgeving nodig (geen overgangskansen of beloningsfunctie). Het update de Q-waarde met behulp van de Bellman-vergelijking: Q(s, a) ← Q(s, a) + α [r + γ max_a' Q(s', a') - Q(s, a)], waarbij α de leersnelheid is, γ de disconteringsfactor, r de ontvangen beloning en s' de volgende toestand. De term max_a' Q(s', a') is de maximale geschatte waarde van de volgende toestand. Q-learning is een off-policy algoritme: het leert de optimale Q-functie ongeacht het gevolgde beleid, zolang alle acties maar voldoende worden verkend. Dit maakt het flexibel. Het gebruikt vaak een ε-greedy beleid voor exploratie: met kans ε wordt een willekeurige actie gekozen, anders de actie met de hoogste Q-waarde. Q-learning convergeert naar de optimale Q-functie onder bepaalde voorwaarden, zoals voldoende exploratie en een afnemende leersnelheid. Het is eenvoudig te implementeren en vormt de basis voor deep Q-networks (DQN).

Beperkingen en uitbreidingen

Q-learning werkt goed voor kleine, discrete toestands- en actieruimten. Bij grote of continue ruimten is een tabel niet praktisch. Dan wordt een functiebenadering gebruikt, zoals een neuraal netwerk (Deep Q-Network). Q-learning heeft echter last van de vloek van dimensionaliteit: het aantal toestanden groeit exponentieel met het aantal features. Ook kan het instabiel zijn bij functiebenadering, een probleem dat DQN oplost met experience replay en target networks. Een andere uitdaging is de exploration-exploitation trade-off. ε-greedy is eenvoudig maar niet altijd efficiënt. Betere strategieën zijn Boltzmann-exploratie, optimistic initialization en count-based exploration. Q-learning is off-policy, wat betekent dat het kan leren van data die door een ander beleid is gegenereerd, bijvoorbeeld oude ervaringen opgeslagen in een replay buffer. Dit maakt het sample-efficiënter. Varianten zoals Double Q-learning verminderen de overschatting van Q-waarden. SARSA is een on-policy alternatief dat de waarde leert van het gevolgde beleid. Q-learning blijft een fundamenteel algoritme in reinforcement learning en wordt veel gebruikt in onderwijs, onderzoek en toepassingen zoals robotica en spelletjes.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.