Wat is reinforcement learning?
Reinforcement learning is een manier van leren waarbij een systeem niet uit voorbeelden leert, maar uit ervaring: het probeert iets, krijgt een beloning of straf, en past zijn gedrag aan.
Hoe het werkt
Stel je een programma voor dat een spel leert. In het begin doet het willekeurige zetten. Wint het, dan krijgt het een positief signaal; verliest het, een negatief. Na miljoenen potjes ontwikkelt het strategieën die geen mens het heeft geleerd.
Bekende doorbraken
Systemen die de wereldkampioen Go versloegen met zetten die experts eerst als fouten bestempelden, leerden op deze manier. Ook robots die leren lopen gebruiken dit principe.
Ook in taalmodellen
Moderne chatbots worden hiermee bijgestuurd: mensen beoordelen antwoorden, en het model leert welke reacties gewaardeerd worden. Dat is precies wat een ruw model verandert in een behulpzame assistent.
Waarom het lastig is
Je moet nauwkeurig definiëren wat "goed" betekent. Beloon je het verkeerde, dan wordt het systeem daar heel goed in — met ongewenste uitkomsten als gevolg. Dat is een reëel probleem in de praktijk.
De kern
Reinforcement learning is krachtig waar je wel kunt beoordelen of een uitkomst goed is, maar niet kunt uitleggen hoe je er komt.