Nieuwe multimodale Pistis-modellen combineren SFT en versterkend leren
Onderzoekers hebben de Pistis-familie gepresenteerd, bestaande uit multimodale grote taalmodellen in verschillende groottes. De modellen zijn getraind via een nieuwe methode die op-beleid distillatie en versterkend leren combineert.
Er is een nieuwe familie van multimodale taalmodellen aangekondigd onder de naam Pistis. Deze modellen zijn gebouwd op bestaande architecturen en zijn tot stand gekomen via een schaalbaar trainingskader. Dit proces begint met grootschalige multimodale fijnafstemming.
Nieuwe trainingsmethoden voor AI-modellen
Vervolgens wordt een techniek toegepast die bekendstaat als Interleaved Distillation and Reinforcement Learning. Deze aanpak integreert op-beleid distillatie en versterkend leren nauw met elkaar tijdens de post-training fase. Dergelijke methoden worden vaker ingezet om de prestaties van taalmodellen verder te optimaliseren nadat de basistraining is voltooid.
Deze samenvatting is gebaseerd op een origineel artikel van arXiv (cs.AI). Lees het volledige, originele bericht bij de bron.
Lees het originele artikel