Terug naar nieuws
Modellen

OpenAI's GPT-6 Astra minder gevoelig voor hallucinaties, kwetsbaar voor indirecte aanvallen

4 september 2026Samengevat door AI Dagblad-redactieBron: The Decoder

Het model GPT-6 Astra van OpenAI presteert beter op het gebied van hallucinaties en directe prompt-injecties dan zijn voorganger. Toch blijft het kwetsbaar wanneer kwaadaardige instructies verborgen zitten in documenten die de AI verwerkt. Voor zelfstandig opererende systemen die met echte data werken, blijft dit risico een belangrijk aandachtspunt.

Uit recente bevindingen blijkt dat het taalmodel GPT-6 Astra van OpenAI erin slaagt om het aantal hallucinaties te verlagen en directe pogingen tot manipulatie grotendeels tegen te houden. Waar directe aanvallen nagenoeg volledig worden gebblokkeerd, ligt dat anders bij indirecte methoden. Wanneer instructies worden verstopt in documenten die het model leest, slagen dergelijke pogingen alsnog in een deel van de scenario's. Vergelijkbare systemen tonen in dit opzicht wisselende resultaten.

De uitdaging van autonome agenten

Dit soort kwetsbaarheden laat zien hoe complex het is om taalmodellen volledig veilig te ontwerpen, met name naarmate ze geavanceerder worden en taken zelfstandig gaan uitvoeren. Moderne AI-systemen worden steeds vaker ingezet als autonome agenten die zelfstandig documenten doorspitten en beslissingen nemen op basis van externe informatie. Zodra zo'n systeem gevoelig blijkt voor listige instructies in ontrusted data, ontstaan er potentiële risico's voor de praktijk. De beveiliging van taalmodellen tegen verborgen manipulatie blijft dan ook een actief onderzoeksveld binnen de kunstmatige intelligentie.

Deze samenvatting is gebaseerd op een origineel artikel van The Decoder. Lees het volledige, originele bericht bij de bron.

Lees het originele artikel

Van de makers van AI Dagblad

Wil je AI inzetten in je eigen bedrijf?

Van een slimme assistent tot een agent die je administratie doet — wij bouwen het betaalbaar. Stel vrijblijvend je vraag.