Terug naar nieuws
Onderzoek

Nieuwe multimodale Pistis-modellen combineren SFT en versterkend leren

25 september 2026•Samengevat door AI Dagblad-redactie•Bron: arXiv (cs.AI)

Onderzoekers hebben de Pistis-familie gepresenteerd, bestaande uit multimodale grote taalmodellen in verschillende groottes. De modellen zijn getraind via een nieuwe methode die op-beleid distillatie en versterkend leren combineert.

Er is een nieuwe familie van multimodale taalmodellen aangekondigd onder de naam Pistis. Deze modellen zijn gebouwd op bestaande architecturen en zijn tot stand gekomen via een schaalbaar trainingskader. Dit proces begint met grootschalige multimodale fijnafstemming.

Nieuwe trainingsmethoden voor AI-modellen

Vervolgens wordt een techniek toegepast die bekendstaat als Interleaved Distillation and Reinforcement Learning. Deze aanpak integreert op-beleid distillatie en versterkend leren nauw met elkaar tijdens de post-training fase. Dergelijke methoden worden vaker ingezet om de prestaties van taalmodellen verder te optimaliseren nadat de basistraining is voltooid.

Deze samenvatting is gebaseerd op een origineel artikel van arXiv (cs.AI). Lees het volledige, originele bericht bij de bron.

Lees het originele artikel

Van de makers van AI Dagblad

Wil je AI inzetten in je eigen bedrijf?

Van een slimme assistent tot een agent die je administratie doet — wij bouwen het betaalbaar. Stel vrijblijvend je vraag.