Verbetering voor asymmetrische actor-critic-methoden in versterkend leren
Wetenschappers hebben gekeken naar de rol van het geheugen in de critic binnen asymmetrische versterkend-lerensystemen. Dit is met name van toepassing op situaties waarin agents op basis van visuele waarnemingen moeten handelen.
Binnen versterkend leren worden vaak asymmetrische architecturen ingezet, waarbij het sturende model tijdens de training extra informatie krijgt die tijdens de daadwerkelijke uitvoering niet beschikbaar is. Bij complexe omgevingen waarin een agent alleen gedeeltelijke waarnemingen heeft, hangt de optimale strategie af van de volledige geschiedenis van eerdere acties en waarnemingen.
Het onderzoek richt zich op situaties waarin de critic uitsluitend op de actuele toestand wordt gebaseerd, wat kan leiden tot vertekende beleidsgradiënten. Door de combinatie van historische data en de omgevingsstaat beter te verwerken, kunnen onderzoekers betere beleidsstrategieën trainen voor visuele volg- en ontwijkingsproblemen.
Deze samenvatting is gebaseerd op een origineel artikel van arXiv (cs.LG). Lees het volledige, originele bericht bij de bron.
Lees het originele artikel