Nieuw taalmodel vermindert hallucinaties maar blijft kwetsbaar voor injecties

Een geavanceerd AI-model produceert minder onjuiste antwoorden dan zijn voorganger en weert vrijwel alle directe manipulatiespogingen af. Toch slagen onzichtbare aanvallen via verstopte instructies in documenten er nog steeds in om het systeem te omzeilen.
Het recente taalmodel laat op het gebied van betrouwbaarheid vooruitgang zien doordat het minder onjuiste informatie fabriceert en nagenoeg alle directe pogingen tot misleiding weet te blokkeren. Uit veiligheidstests blijkt echter dat het model nog steeds kwetsbaar is wanneer kwaadwillende instructies worden verborgen in documenten die de kunstmatige intelligentie moet doorzoeken en verwerken.
Bij dergelijke indirecte aanvallen lukt het in een aantal gevallen alsnog om de ingebouwde veiligheidsfilters te omzeilen. Vergelijkbare systemen van andere aanbieders scoren op dit specifieke onderdeel soms iets beter, maar de risico's blijven vooralsnog substantieel.
Veiligheidsuitdagingen voor autonome toepassingen
Naarmate kunstmatige intelligentie vaker wordt ingezet in autonome systemen die zelfstandig gegevens verwerken en acties ondernemen, worden beveiligingsrisico's zoals verborgen instructies steeds urgenter. Het tegengaan van dergelijke kwetsbaarheden is een van de grootste uitdagingen voor onderzoekers om AI-agenten veilig te laten functioneren in reële bedrijfsprocessen.
Deze samenvatting is gebaseerd op een origineel artikel van The Decoder. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel