Efficiënter trainen van AI door gerichte beloning van verkenning
Wetenschappers introduceren een techniek om redundante verkenning te verminderen bij het trainen van parallelle AI-systemen. Hierdoor kunnen afzonderlijke agenten effectiever bijdragen aan het gezamenlijke leerproces.
Bij het trainen van versterkend leren worden vaak meerdere beleidsstrategieën tegelijkertijd ingezet om een omgeving te verkennen. Veelvoorkomende methoden sturen echter op een gezamenlijke score, waardoor het lastig is om te bepalen welke specifieke strategie daadwerkelijk unieke ontdekkingen doet.
Marginal Coverage Credit
De voorgestelde methode, genaamd Marginal Coverage Credit, berekent nauwkeuriger de individuele bijdrage van elke aparte strategie aan het totaal. Hierdoor wordt dubbel werk voorkomen en worden agents gestimuleerd om nieuwe deelgebieden van de staat-ruimte te onderzoeken.
Dit soort optimalisaties zijn belangrijk om de computerspanning en energiekosten van het trainen van complexe AI-modellen te beperken. Efficiënter leren draagt bij aan snellere ontwikkelingstijden binnen het vakgebied van machine learning.
Deze samenvatting is gebaseerd op een origineel artikel van arXiv (cs.LG). Lees het volledige, originele bericht bij de bron.
Lees het originele artikel