Wat is een agent omgeving actie en beloning?
De bouwstenen van reinforcement learning
In reinforcement learning worden vier kernbegrippen onderscheiden: agent, omgeving, actie en beloning. De agent is het lerende systeem dat beslissingen neemt. De omgeving is alles buiten de agent waarmee hij interacteert. Op elk tijdstip observeert de agent een toestand van de omgeving en kiest een actie. De omgeving reageert met een nieuwe toestand en een beloning. De beloning is een scalair signaal dat aangeeft hoe goed de actie was in de gegeven context. Het doel van de agent is om een beleid te leren dat de verwachte cumulatieve beloning maximaliseert. Dit proces wordt herhaald in episodes of continu. De agent moet een balans vinden tussen exploratie en exploitatie. De omgeving kan deterministisch of stochastisch zijn, volledig of gedeeltelijk waarneembaar. Bij een gedeeltelijk waarneembare omgeving heeft de agent geen volledige informatie over de toestand, wat het probleem moeilijker maakt. De beloning kan direct of vertraagd zijn. Vertraagde beloningen maken het moeilijk om te leren welke actie goed was. Dit staat bekend als het credit assignment problem. De interactie tussen agent en omgeving wordt vaak geformaliseerd als een Markov Decision Process (MDP).
Voorbeelden en formalisatie
Een klassiek voorbeeld van een RL-probleem is een robot die een kamer moet navigeren. De agent is de robot, de omgeving is de kamer, acties zijn bewegingen (vooruit, achteruit, links, rechts), en beloningen kunnen positief zijn bij het bereiken van een doel en negatief bij een botsing. Een ander voorbeeld is een spelprogramma dat Atari speelt: de agent ziet pixels, kiest joystick-acties en ontvangt de score als beloning. In finance kan een agent leren handelen op de beurs, met de omgeving als de markt en beloning als winst. Formeel wordt een MDP beschreven door een tuple (S, A, P, R, γ), waarbij S de toestandsruimte is, A de actieruimte, P de overgangskansen, R de beloningsfunctie en γ de disconteringsfactor. De disconteringsfactor bepaalt hoeveel waarde wordt gehecht aan toekomstige beloningen. Een waarde dicht bij 0 betekent kortzichtig; dicht bij 1 betekent ver vooruitkijken. De agent leert een beleid π: S → A dat de verwachte return maximaliseert. Return is de som van verdisconteerde beloningen. Als de omgeving onbekend is, moet de agent leren door interactie. Dit is het reinforcement learning-probleem in zijn puurste vorm.