Ontwikkelaars omzeilen onzichtbare watermerken van Claude binnen paar uur

Kort nadat Anthropic onzichtbare watermerken introduceerde om aan Europese regelgeving te voldoen, wisten programmeurs deze al te passeren. Uit online reacties blijkt dat de ingebouwde identificatie voor AI-gegenereerde teksten eenvoudig is uit te schakelen. Dit roept vragen op over de effectiviteit van dergelijke nalevingsmaatregelen.
Programmeurs hebben kort na de introductie van nieuwe detectietechnologie door Anthropic ontdekt hoe deze is te omzeilen. De specifieke techniek, bedoeld om door kunstmatige intelligentie geproduceerde output te voorzien van een onzichtbare herkenning, bleek binnen zeer korte tijd uit te schakelen. Dit roept direct vragen op over de praktische haalbaarheid en betrouwbaarheid van dergelijke identificatiemethoden.
Vragen over naleving van regels
Het incident werpt een scherp licht op de uitdagingen waar makers van taalmodellen voor staan bij het voldoen aan wet- en regelgeving. Aanbieders van kunstmatige intelligentie zoeken naar wegen om te voldoen aan wettelijke verplichtingen rondom transparantie, zoals die in Europa op stapel staan of gelden. Watermerken moeten helpen om onderscheid te maken tussen menselijke en machinale creaties, maar de praktijk blijkt weerbarstig wanneer gebruikers met minimale technische aanpassingen de ingebouwde beperkingen opheffen.
De ontwikkelingen tonen aan dat het creëren van watermerken voor generatieve systemen een kat-en-muisspel is. Waar wetgevers inzetten op technische waarborgen om misbruik of desinformatie tegen te gaan, beschikken ontwikkelaars vaak over de middelen om deze beveiligingen te neutraliseren. Dit zet druk op het debat over de vraag of technische beperkingen in de software zelf wel de juiste manier zijn om naleving af te dwingen.
Deze samenvatting is gebaseerd op een origineel artikel van Wired AI. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel