OpenAI voert een onzichtbaar watermerk met de naam textGrain in voor uitvoer van ChatGPT en Codex. In de Europese Unie staat het straks standaard aan. Volgens het bedrijf wordt de functie de komende weken geactiveerd om te voldoen aan de eis uit de EU AI Act dat gegenereerde tekst op een machineleesbare manier kan worden gemarkeerd. Ontwikkelaars die de API van OpenAI gebruiken, kunnen het watermerk naar keuze in- of uitschakelen. Dat verschilt van de aanpak van Anthropic, dat wereldwijd verplicht een watermerk toevoegt aan alle uitvoer van Claude.
Hoe het watermerk werkt en wat de beperkingen zijn
textGrain voegt een statistisch patroon toe aan de woordkeuze van het model, vergelijkbaar met SynthID van Google, dat wordt gebruikt bij Claude van Anthropic. Uit interne tests van OpenAI blijkt dat de detector het patroon herkent in ongeveer 95 % van psychologieteksten van 400 tokens (ongeveer 300 woorden), maar in slechts circa 60 % van wiskundeteksten van dezelfde lengte. Zelfs kleine aanpassingen aan de tekst verminderen de detectiekans: als 10 % van de woorden wordt vervangen door synoniemen, daalt het herkenningspercentage van ongeveer 92 % naar 66 %. Bij vervanging van een kwart van de woorden zakt het naar circa 17 %.
Toegang tot de detector
Voorlopig geeft OpenAI alleen geselecteerde onderzoekers en gespecialiseerde organisaties toegang tot de detector, na een aanvraagprocedure. De tool geeft alleen aan of er een watermerk van OpenAI aanwezig is; hij onthult niet wie de tekst heeft geschreven of welke prompts zijn gebruikt.
Waarom het ertoe doet
EU-gebruikers krijgen een verborgen markering op ChatGPT-uitvoer die toezichthouders kunnen uitlezen, zodat OpenAI aan nieuwe etiketteringsregels kan voldoen. Ontwikkelaars kunnen ervoor kiezen de markering uit te schakelen, wat van invloed kan zijn op hoe gemakkelijk derden AI-gegenereerde tekst herkennen. Doordat de detectiekans na bewerking laag is, kunnen gebruikers het watermerk mogelijk nog steeds verwijderen door de tekst enigszins te herformuleren.