Trainingsmethode genereert synthetische trainingsdata via code
Een nieuwe studie onderzoekt hoe taalmodellen getraind kunnen worden met synthetische data die automatisch uit code worden gegenereerd. Dit biedt een oplossing voor domeinen waar onvoldoende gelabelde praktijkdata voorhanden zijn.
Grootschalige taalmodellen hebben doorgaans grote hoeveelheden gelabelde voorbeelden nodig om goed te generaliseren binnen een specifiek vakgebied, terwijl dergelijke data in de praktijk vaak ontbreken. Onderzoekers tonen aan dat dit probleem is te omzeilen wanneer de dynamiek van een domein in programmeercode kan worden gegoten. Uit zo'n codebasis zijn namelijk automatisch talloze uitvoerbare en verifieerbare wereldmodellen te destilleren.
Door taalmodellen te trainen op de trajecten uit deze gesimuleerde werelden, kunnen ze hun generalisatievermogen vergroten zonder dat daar dure handmatige annotaties voor nodig zijn. Deze aanpak van trainingsfase-berekening vormt een alternatief voor methoden die alleen tijdens de inferentiefase extra rekenkracht inzetten.
Deze samenvatting is gebaseerd op een origineel artikel van arXiv (cs.LG). Lees het volledige, originele bericht bij de bron.
Lees het originele artikel