Claude inclura des marques invisibles pour indiquer qu’un texte a été généré par IA

Claude AI est devenu dangereusement incontrôlable, selon Anthropic

L’entreprise Anthropic a annoncé que son chatbot Claude va désormais intégrer des marqueurs invisibles destinés à signaler qu’un texte a été produit par une intelligence artificielle.

Cette mise à jour répond aux exigences de la législation européenne sur l’intelligence artificielle (AI Act). Ce texte impose aux entreprises du secteur de déployer des méthodes de détection des contenus générés par IA. Cette décision intervient alors que de nombreuses voix s’inquiètent de l’envahissement d’Internet par des médias de faible qualité fabriqués par des algorithmes, un phénomène que l’on appelle désormais le « fourrage IA » (AI slop).

Conformément aux règles européennes, ces filigranes invisibles seront appliqués à la fois sur les textes et les images. Le système sera déployé à l’échelle mondiale et concernera même des usages spécifiques du chatbot, comme Claude Code.

Les filigranes sur les images générées par IA sont déjà courants et relativement simples à mettre en œuvre. Ils insèrent dans l’image une série d’indices qu’un œil humain ne peut pas voir, mais que des systèmes automatisés parviennent à détecter.

Cette technique présente toutefois des limites. Un utilisateur peut supprimer le filigrane en convertissant l’image ou en réalisant une capture d’écran.

Le changement le plus surprenant et le plus controversé concerne le texte. Anthropic a en effet annoncé l’introduction de fonctionnalités similaires pour la génération de texte. L’entreprise précise que ce texte contiendra lui aussi une trace invisible que les systèmes automatisés pourront repérer, mais qui restera imperceptible pour les humains.

Cette fonctionnalité suscite déjà la controverse. Certains utilisateurs craignent, par exemple, que le fait de demander à Claude de corriger un texte ne conduise à un signalement erroné de ce texte comme étant intégralement produit par une machine. Anthropic reconnaît cette limite. L’entreprise précise que la « marque Claude » pourrait apparaître même dans des cas où « les idées, le texte ou les données sous-jacentes proviennent d’une autre source ».

« Une marque détectée fournit un signal indiquant que le contenu a été traité par Claude, mais elle n’est pas totalement concluante », a prévenu Anthropic. « Détecter une marque Claude vous indique que le contenu a pu être traité par Claude, mais elle ne confirme pas à elle seule la provenance complète du contenu. »

L’entreprise ajoute que l’absence de ce filigrane ne signifie pas forcément que le texte n’a pas été généré ou traité par une IA. Le texte peut provenir d’un modèle antérieur à l’introduction de la marque, avoir été lourdement édité ou modifié, ou être trop court pour contenir un signal fiable.

Anthropic n’a pas fourni de détails précis sur la méthode d’intégration de ces filigranes dans le texte. Cette discrétion vise probablement à empêcher les utilisateurs de trouver un moyen de les retirer. Les technologies similaires fonctionnent généralement soit en utilisant des caractères invisibles spécifiques, soit en choisissant certains mots plus que d’autres. On pense que Claude utilise cette seconde méthode.

Cette technique pourrait consister à utiliser une proportion plus élevée ou plus faible d’un mot particulier, de sorte qu’une analyse statistique puisse le repérer. Anthropic insiste sur le fait que le procédé restera imperceptible et qu’il ne « changera pas le sens, la qualité ou la lisibilité de la réponse de Claude ».

Par le passé, d’autres technologies de détection des textes générés par IA ont rencontré de nombreux problèmes. Il serait possible de sauvegarder tous les messages générés par un chatbot et de comparer un texte suspect à cette base de données. Mais cette approche soulève des problèmes pratiques et des préoccupations en matière de confidentialité concernant le stockage de toutes ces conversations. D’autres options existantes consistent à analyser le texte après sa génération pour y trouver les signes caractéristiques de l’écriture d’une IA, comme des mots ou des constructions de phrases particuliers. Mais cette méthode requiert d’importantes ressources informatiques et ne fonctionne pas toujours de manière fiable.

Dans un premier temps, Anthropic ajoutera ces marques à tout contenu généré par les modèles introduits après le 2 août de cette année. L’entreprise prévoit d’étendre cette fonctionnalité aux modèles plus anciens.