Terug naar kennisbank
Kennisbank · Gevorderd

Wat is reinforcement learning?

5 min lezenUitleg door de AI Dagblad-redactie

Reinforcement learning is een manier van leren waarbij een systeem niet uit voorbeelden leert, maar uit ervaring: het probeert iets, krijgt een beloning of straf, en past zijn gedrag aan.

Hoe het werkt

Stel je een programma voor dat een spel leert. In het begin doet het willekeurige zetten. Wint het, dan krijgt het een positief signaal; verliest het, een negatief. Na miljoenen potjes ontwikkelt het strategieën die geen mens het heeft geleerd.

Bekende doorbraken

Systemen die de wereldkampioen Go versloegen met zetten die experts eerst als fouten bestempelden, leerden op deze manier. Ook robots die leren lopen gebruiken dit principe.

Ook in taalmodellen

Moderne chatbots worden hiermee bijgestuurd: mensen beoordelen antwoorden, en het model leert welke reacties gewaardeerd worden. Dat is precies wat een ruw model verandert in een behulpzame assistent.

Waarom het lastig is

Je moet nauwkeurig definiëren wat "goed" betekent. Beloon je het verkeerde, dan wordt het systeem daar heel goed in — met ongewenste uitkomsten als gevolg. Dat is een reëel probleem in de praktijk.

De kern

Reinforcement learning is krachtig waar je wel kunt beoordelen of een uitkomst goed is, maar niet kunt uitleggen hoe je er komt.

Lees ook

Persoonlijke hulp

Vragen na het lezen?

Onze AI-experts leggen het je persoonlijk uit en helpen je het toe te passen in je eigen bedrijf. Plan een vrijblijvende afspraak.

Boek een afspraak met een expert