OpenAI déploie textGrain, un filigrane invisible pour les réponses de ChatGPT et les contenus générés par Codex, qui sera activé pour les utilisateurs de l’Union européenne. L’entreprise indique que la fonctionnalité sera mise en service dans les prochaines semaines afin de respecter l’exigence du règlement européen sur l’IA, selon laquelle les textes générés doivent pouvoir être étiquetés de manière lisible par une machine. Les développeurs qui utilisent l’API d’OpenAI pourront activer ou désactiver le filigrane à leur guise, contrairement à l’approche d’Anthropic, qui impose un filigrane à toutes les réponses de Claude dans le monde entier.
Fonctionnement et limites du filigrane
textGrain insère un motif statistique dans le choix des mots du modèle, à l’image de SynthID de Google, utilisé par Claude d’Anthropic. Selon les tests internes d’OpenAI, le détecteur repère le motif dans environ 95 % des textes de psychologie de 400 tokens (soit environ 300 mots), mais dans seulement quelque 60 % des textes de mathématiques de même longueur. Même de petites modifications du texte réduisent le taux de détection : remplacer 10 % des mots par des synonymes le fait passer d’environ 92 % à 66 %, et remplacer un quart des mots le ramène à environ 17 %.
Accès au détecteur
Pour l’instant, OpenAI ne donnera accès au détecteur qu’à des chercheurs sélectionnés et à des organismes spécialisés, après examen de leur demande. L’outil indiquera simplement si un filigrane d’OpenAI est présent ; il ne révélera ni l’auteur du texte ni les prompts utilisés.
Pourquoi c'est important
Les utilisateurs de l’UE verront les réponses de ChatGPT marquées d’un signal caché que les autorités pourront détecter, ce qui contribuera au respect des nouvelles règles d’étiquetage. Les développeurs pourront choisir de masquer ce signal, ce qui pourrait compliquer la détection des textes générés par l’IA par des tiers. Comme le taux de détection chute fortement après modification, une reformulation même modeste pourrait permettre de supprimer le filigrane.