Kennis overdragen tussen verschillende AI-modellen zonder hertraining
Onderzoekers tonen aan dat kleinere taalmodellen prestatieverbeteringen kunnen behalen door kennis te absorberen van grotere varianten. Dit gebeurt via een gerichte snoeimethode, waarbij geen complexe afstemming van individuele neuronen vereist is ondanks de verschillende architecturaal onderliggende structuren.
Wetenschappers hebben een techniek gepresenteerd waarmee compacte taalmodellen slimmer kunnen worden gemaakt door inzichten over te nemen van omvangrijke systemen. Uit publicaties op wetenschappelijk platform arXiv blijkt dat dit mogelijk is via een specifieke methode waarbij overtollige onderdelen worden weggesneden, zonder dat daarvoor ingewikkelde aanpassingen aan de onderliggende neuronen nodig zijn. Dit werkt zelfs wanneer de opbouw van de betrokken systemen onderling flink verschilt.
Efficiënter werken met computercapaciteit
Binnen de wereld van kunstmatige intelligentie is de ontwikkeling van steeds grotere systemen gebruikelijk, maar deze vragen om aanzienlijke rekenkracht en energie. Het overdragen van capaciteiten van zware naar lichtere varianten is daarom een belangrijk aandachtsgebied binnen het vakgebied. Waar dergelijke overdrachten doorgaans veel tijd en middelen kosten, laat deze nieuwe methode zien dat het efficiënter kan.
De bevindingen sluiten aan bij een bredere trend waarin onderzoekers zoeken naar manieren om de prestaties van compacte modellen te vergroten zonder dat de schaalbaarheid en snelheid verloren gaan. Door kennis effectiever te hergebruiken, kan kunstmatige intelligentie breder worden ingezet op apparaten met minder rekenkracht.
Deze samenvatting is gebaseerd op een origineel artikel van arXiv (cs.LG). Lees het volledige, originele bericht bij de bron.
Lees het originele artikel