Rlhf reinforcement learning from human feedback

Het RLHF-proces

Reinforcement Learning from Human Feedback (RLHF) is een techniek om AI-modellen, met name grote taalmodellen, af te stemmen op menselijke waarden en voorkeuren. Het proces verloopt in drie fasen. Eerst wordt een vooraf getraind taalmodel (pre-trained model) gebruikt om meerdere reacties op een prompt te genereren. Menselijke beoordelaars rangschikken deze reacties op kwaliteit. Vervolgens wordt een beloningsmodel getraind op deze vergelijkingen. Het beloningsmodel leert voorspellen welke reactie een mens beter vindt. Ten slotte wordt het taalmodel geoptimaliseerd met reinforcement learning, meestal met PPO, waarbij het beloningsmodel als beloningsfunctie dient. Het doel is om reacties te genereren die hoog scoren volgens het beloningsmodel. RLHF is cruciaal geweest voor de ontwikkeling van modellen zoals ChatGPT en Claude. Het helpt bij het verminderen van schadelijke, misleidende of onsamenhangende output. Het is echter duur en tijdrovend, omdat er veel menselijke annotaties nodig zijn. Ook kan het beloningsmodel worden misbruikt (reward hacking), waarbij het model de beloning maximaliseert zonder de gewenste kwaliteit te leveren. RLHF is een actief onderzoeksgebied, met varianten zoals Direct Preference Optimization (DPO) die zonder expliciete RL werken.

Uitdagingen en alternatieven

RLHF kent verschillende uitdagingen. Het verzamelen van hoogwaardige menselijke feedback is kostbaar en schaalt moeilijk. De voorkeuren van beoordelaars kunnen inconsistent of bevooroordeeld zijn. Het beloningsmodel kan fouten maken, vooral buiten de distributie van de trainingsdata. Reward hacking is een reëel risico: het model leert de beloning te maximaliseren op manieren die niet in lijn zijn met de intentie. Ook kan RLHF leiden tot een afname van diversiteit in de output, omdat het model zich richt op wat mensen gemiddeld genomen goed vinden. Alternatieven voor RLHF zijn RLAIF (Reinforcement Learning from AI Feedback), waarbij een AI-model de rol van menselijke beoordelaar overneemt. Dit is goedkoper en schaalt beter, maar de kwaliteit hangt af van het beoordelende model. DPO (Direct Preference Optimization) is een eenvoudiger alternatief dat geen reinforcement learning gebruikt, maar direct het taalmodel optimaliseert op basis van preferentieparen. Het is stabieler en eenvoudiger te implementeren. Constitutionele AI is een aanpak waarbij een set regels (een 'constitutie') wordt gebruikt om het model te sturen, zonder menselijke feedback per voorbeeld. RLHF blijft een hoeksteen van de alignment van AI-systemen.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.