Page d'accueilCentre d'actualités LBank
Anthropic appose discrètement un filigrane à chaque sortie de Claude AI. Les développeurs essaient déjà de le contourner.
anthropic-quietly-watermarking-ai-claude-output-builders-break
Anthropic appose discrètement un filigrane à chaque sortie de Claude AI. Les développeurs essaient déjà de le contourner.
Anthropic tisse une marque invisible, lisible par machine, dans chaque mot que rédigent ses nouveaux modèles Claude — et n’a pas révélé comment.
2026-08-13 Source:decrypt.co

En bref

  • Les nouveaux modèles Claude lancés dans l'UE à partir du 2 août 2026 intègrent un filigrane lisible par machine dans chaque élément de texte généré, appliqué au niveau du modèle.
  • Les marquages s'appliquent dans le monde entier à travers Claude, l'API, Claude Code et les partenaires cloud.
  • Des projets open source pour les supprimer sont apparus en quelques jours.

Anthropic a commencé à intégrer un filigrane imperceptible dans tout le texte généré par ses plus récents modèles Claude. Ce changement est entré en vigueur pour les modèles lancés dans l'UE le 2 août 2026, et Anthropic affirme qu'il s'appliquera dans le monde entier.

Anthropic a présenté ce plan dans un article de support après avoir signé le Code de bonne conduite sur la transparence de la Loi européenne sur l'IA. En d'autres termes, ce n'est pas exactement de plein gré qu'elle le fait. Cette marque se retrouve sur toutes les interfaces Claude, du chatbot et de l'API à Claude Code et aux partenaires cloud tels qu'AWS, Google Cloud et Microsoft Foundry.

Myriad : Quand OpenAI publiera-t-il GPT-6 ? Cliquez pour faire votre prédiction.

« Lorsqu'un modèle Claude pris en charge génère du texte, il tisse un filigrane imperceptible directement dans le texte lui-même. Vous ne le verrez pas, et il ne modifie pas le sens, la qualité ou la lisibilité de la réponse de Claude », a déclaré Anthropic. « Parce que le filigrane fait partie du texte, il voyagera avec le texte lorsqu'il sera copié et collé ailleurs, et pourra persister après certaines modifications. »

C'est donc un peu plus complexe que les méthodes habituelles auxquelles les utilisateurs pensent. Lorsqu'un modèle Claude pris en charge écrit du texte, il tisse un filigrane imperceptible directement dans les mots, sans balise visible. Parce que la marque fait partie du texte, elle survit au copier-coller et, comme l'admet Anthropic, « peut persister après certaines modifications ». Les fichiers bénéficient d'une deuxième couche : des métadonnées signées selon la norme ouverte C2PA (imaginez un manifeste d'expédition numérique qui enregistre qui a produit un fichier et si quelqu'un l'a modifié par la suite).

La méthode reste secrète

Anthropic n'a pas divulgué la méthode de création du filigrane. L'article de support le qualifie de « niveau modèle » (le modèle est entraîné avec) et de « natif au texte » (ce n'est pas un outil externe comme un générateur de métadonnées, par exemple), mais la documentation de détection et la technique exacte ne sont pas encore publiées.

Les chercheurs en déduisent qu'il s'agit d'une signature statistique : le modèle oriente ses choix de mots vers un léger biais détectable, une approche similaire à celle utilisée par Google dans SynthID Text. Cela reste une supposition jusqu'à ce qu'Anthropic publie le détecteur.

Mais cela ne décourage pas les défenseurs de la vie privée, et certains experts travaillent déjà sur des méthodes pour briser le filigrane secret d'Anthropic. mikiane/claude-watermark-cleaner (106 étoiles sur Github) nettoie l'Unicode invisible, puis réécrit le texte avec un modèle non-Claude pour perturber le schéma des tokens.

Un projet plus vaste, guillaumemeyer/watermarks-remover (4,6k étoiles sur Github), supprime les marques de texte Claude ainsi que les signaux de type C2PA et SynthID sur les fichiers PNG, JPEG, SVG, PDF et DOCX. Les auteurs affirment qu'une marque de texte statistique n'est « pas un moyen fiable de prouver l'origine » et pousse principalement les utilisateurs à effectuer un deuxième passage de modèle pour nettoyer leur propre écriture. Aucune suppression ne peut être garantie tant qu'Anthropic n'aura pas publié son détecteur et ses seuils.

L'histoire d'Anthropic elle-même rend la réaction en matière de vie privée plus vive. La société a supprimé un traqueur caché de Claude Code en mars après que des chercheurs ont découvert qu'il marquait la localisation et l'utilisation de proxy de certains utilisateurs via des marqueurs Unicode non divulgués — la même technique de marquage discret qui est maintenant au cœur du plan de filigrane.

La marque prouve que Claude a contribué au texte, pas qu'il l'a écrit en entier, elle traitera donc une écriture originale avec une petite modification de la même manière qu'un texte entièrement généré par l'IA. Demandez à Claude de relire ou de traduire votre paragraphe et le résultat pourra toujours porter le signal. Anthropic reconnaît que des modifications importantes peuvent le supprimer, et qu'une marque manquante ne prouve pas qu'un humain a écrit quelque chose.

Un projet de loi américain, le COPIED Act, promeut la même idée : une méthode standardisée de filigranage du contenu IA afin que les plateformes puissent en tracer l'origine. Comme l'a montré le problème de chantage de Claude, les modèles de l'entreprise sont déjà soumis à un examen intense concernant ce qu'ils font avec le texte qu'ils traitent.

Anthropic n'a pas indiqué quand elle publiera les outils de détection qui permettraient à quiconque de vérifier la marque.