OpenAI führt für Ausgaben von ChatGPT und Codex ein unsichtbares Wasserzeichen namens textGrain ein, das für Nutzer in der Europäischen Union aktiviert wird. Das Unternehmen teilt mit, dass die Funktion in den nächsten Wochen eingeschaltet wird, um die Vorgabe des EU AI Act zu erfüllen, nach der generierte Texte maschinenlesbar gekennzeichnet werden können müssen. Entwickler, die die OpenAI-API nutzen, können das Wasserzeichen nach Belieben ein- oder ausschalten. Das unterscheidet sich von Anthropic, wo ein Wasserzeichen für alle Claude-Ausgaben weltweit vorgeschrieben ist.
So funktioniert das Wasserzeichen – und wo seine Grenzen liegen
textGrain fügt der Wortwahl des Modells ein statistisches Muster hinzu, ähnlich wie Googles SynthID, das bei Anthropics Claude zum Einsatz kommt. Laut internen Tests von OpenAI erkennt der Detektor das Muster in etwa 95 % von 400-Token-Passagen (rund 300 Wörter) über Psychologie, aber nur in etwa 60 % gleich langer Mathematikpassagen. Schon kleine Änderungen am Text verschlechtern die Erkennung: Werden 10 % der Wörter durch Synonyme ersetzt, sinkt die Trefferquote von etwa 92 % auf 66 %. Werden ein Viertel der Wörter ausgetauscht, fällt sie auf rund 17 %.
Zugang zum Detektor
Vorerst gewährt OpenAI nur ausgewählten Forschern und spezialisierten Organisationen nach einem Bewerbungsverfahren Zugang zum Detektor. Das Tool meldet lediglich, ob ein OpenAI-Wasserzeichen vorhanden ist. Es gibt weder Auskunft darüber, wer den Text verfasst hat, noch über verwendete Prompts.
Warum es wichtig ist
Nutzer in der EU erhalten bei ChatGPT-Ausgaben ein verborgenes, für Aufsichtsbehörden lesbares Kennzeichen. Damit soll die Einhaltung neuer Kennzeichnungsvorschriften erleichtert werden. Entwickler können das Kennzeichen ausschalten, was beeinflussen kann, wie leicht Dritte KI-generierte Texte erkennen. Da die Erkennungsrate nach Änderungen stark sinkt, lässt sich das Wasserzeichen offenbar schon durch moderate Umformulierungen entfernen.