Snellere taalmodeltraining dankzij voorspellende voorwaartse passes
Een nieuwe techniek genaamd FPO maakt het mogelijk om grote taalmodellen te trainen zonder traditionele achterwaartse propagatie. Hierdoor stijgt de verwerkingssnelheid aanzienlijk en daalt het piekgeheugenverbruik met bijna de helft, terwijl de modelprestaties behouden blijven.
Onderzoekers hebben een nieuwe methode ontwikkeld die de manier waarop grote taalmodellen worden getraind ingrijpend kan veranderen. Deze techniek, aangeduid als FPO, omzeilt de traditionele methode van achterwaartse propagatie. In plaats daarvan wordt gebruikgemaakt van voorspellende voorwaartse passes om het leerproces van de modellen te doorlopen.
Efficiëntie en geheugengebruik in AI-training
Bij het ontwikkelen van geavanceerde kunstmatige intelligentie vloeit een groot deel van de rekentijd en het geheugen naar de zogeheten backward pass, waarin modelparameters worden bijgewerkt op basis van foutanalyses. Door dit traditionele proces te vervangen, wordt de verwerkingssnelheid flink opgevoerd en kan het piekgeheugen sterk worden teruggebracht. Uit tests blijkt dat de uiteindelijke prestaties van de taalmodellen hierbij overeind blijven.
Deze doorbraak past binnen een bredere trend binnen het veld van machine learning, waar al langere tijd wordt gezocht naar manieren om de schaalbaarheid van AI te verbeteren. Omdat taalmodellen steeds groter en complexer worden, vormen de hoge energiekosten en hardware-eisen een aanzienlijke drempel. Methodes die het trainingsproces efficiënter inrichten zijn daarom cruciaal voor de verdere ontwikkeling van de technologie.
Deze samenvatting is gebaseerd op een origineel artikel van arXiv (cs.LG). Lees het volledige, originele bericht bij de bron.
Lees het originele artikel