Policy gradients
Direct beleid leren
Policy gradient-methoden zijn een familie van reinforcement learning-algoritmen die direct een beleid leren, meestal geparametriseerd door een neuraal netwerk. In tegenstelling tot value-based methoden zoals Q-learning, die eerst waarden leren en daaruit een beleid afleiden, optimaliseren policy gradients het beleid rechtstreeks met behulp van gradiëntascent. Het beleid π_θ(a|s) geeft de kans op actie a in toestand s, gegeven parameters θ. Het doel is om de verwachte return J(θ) te maximaliseren. De gradiënt van J(θ) wordt geschat met de policy gradient-stelling: ∇J(θ) = E[∇_θ log π_θ(a|s) * G], waarbij G de return is. Dit betekent dat acties die tot een hoge return leiden, waarschijnlijker worden gemaakt. Een uitdaging is de hoge variantie van de gradiëntschatting. Technieken zoals baselines, advantage functions en actor-critic methoden verminderen de variantie. REINFORCE is het eenvoudigste policy gradient-algoritme. Het gebruikt Monte Carlo-samples van volledige episodes. Policy gradients kunnen omgaan met continue actieruimten en stochastische beleid. Ze zijn echter sample-inefficiënt en kunnen vastlopen in lokale optima. Moderne varianten zoals PPO, TRPO en SAC zijn zeer succesvol in complexe taken.
Actor-critic en moderne varianten
Actor-critic methoden combineren policy gradients met value-based learning. De actor is het beleid dat acties kiest; de critic is een waardefunctie die de acties evalueert. De critic helpt de variantie van de policy gradient te verlagen. A3C (Asynchronous Advantage Actor-Critic) gebruikt meerdere parallelle agents die asynchroon leren. PPO (Proximal Policy Optimization) is een van de meest gebruikte algoritmen vanwege de eenvoud en stabiliteit. Het beperkt de beleidswijziging per update met een clipped objective, waardoor te grote updates worden vermeden. TRPO (Trust Region Policy Optimization) gebruikt een trust region-constraint. SAC (Soft Actor-Critic) maximaliseert zowel de verwachte return als de entropy van het beleid, wat leidt tot robuustere exploratie. Policy gradients worden gebruikt in robotica, autonoom rijden, spellen en het afstemmen van taalmodellen (RLHF). Ze zijn bijzonder geschikt voor continue actieruimten en problemen waar een stochastisch beleid voordelen biedt. De keerzijde is de hoge samplecomplexiteit: er zijn vaak miljoenen interacties nodig. Onderzoek richt zich op efficiëntere en stabielere algoritmen.