Nieuwe architectuur voor taalmodellen met doorlopende decoderstaat
Een onderzoeker heeft een modelarchitectuur voorgesteld waarbij de decoderstaat over tokens heen behouden blijft. Dit ontwerp combineert een causale encoder met een terugkerende decoder voor langere contextverwerking.
Er is een technische benadering gepresenteerd voor taalmodellen die gebruikmaakt van een zogeheten Recurrent Looped Transformer. In dit ontwerp wordt de definitieve verborgen toestand van de decoder en een specifieke aandachtscache meegenomen over zowel invoer- als antwoordtokens heen, zonder dat er een reset plaatsvindt bij de grenzen van de verwerking.
Transformatormodellen vormen de technische basis van moderne generatieve kunstmatige intelligentie. Traditionele architecturen lopen doorgaans tegen beperkingen aan bij het verwerken van zeer lange reeksen doordat de context op een gegeven moment opnieuw moet worden opgebouwd of ingekort. Nieuwe structuren zoals deze proberen die efficiëntieproblemen op te lossen.
Deze samenvatting is gebaseerd op een origineel artikel van MarkTechPost. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel