[DÉCRYPTAGE] Europe : Claude va désormais porter un filigrane invisible
Dans une annonce publiée le 14 août, l’entreprise indique que ses futurs modèles Claude produiront du texte comportant un filigrane invisible, destiné à permettre d’estimer la probabilité qu’un texte ait été généré ou traité par Claude. La mesure intervient quelques jours après l’entrée en application, le 2 août 2026, des obligations de transparence prévues par l’article 50 de l’AI Act européen. La Commission européenne prévoit notamment des obligations de marquage et de détection des contenus générés ou manipulés par IA. Mais derrière un dispositif qui peut sembler purement technique se joue une question beaucoup plus large : comment rendre l’intelligence artificielle identifiable sans transformer chaque contenu généré par une machine en contenu visiblement estampillé « IA » ?
Le choix d’Anthropic est particulièrement intéressant parce qu’il ne s’agit pas d’ajouter une mention visible au texte. Le filigrane est intégré au processus même de génération. Un modèle comme Claude produit une réponse en sélectionnant successivement des tokens — unités de texte pouvant correspondre à des mots ou à des fragments de mots. Lorsqu’il existe plusieurs possibilités présentant pratiquement le même niveau de pertinence, le système doit effectuer un choix probabiliste. C’est précisément dans ces choix à faible enjeu que le filigrane intervient.
Au lieu de laisser entièrement au hasard la source de cette sélection, le mécanisme utilise une clé cryptographique et le contexte précédent pour orienter ces choix. Pris isolément, chaque mot reste parfaitement naturel. Mais lorsqu’on analyse une quantité suffisante de texte avec la clé appropriée, un motif statistique peut apparaître. Il devient alors possible de déterminer si le texte présente une probabilité élevée d’avoir été généré par Claude.
Anthropic précise que cette approche ne consiste ni à ajouter des caractères invisibles, ni à insérer des informations cachées dans le texte. Elle ne modifie pas non plus la présentation du contenu pour le lecteur.
Anthropic reprend une technologie développée par Google DeepMind
Le mécanisme choisi par Anthropic n’est pas entièrement nouveau. L’entreprise indique utiliser une version de SynthID-Text, une technologie développée par Google DeepMind et publiée dans Nature en 2024.
Les travaux de Google avaient précisément montré qu’il était possible d’intégrer un filigrane directement dans le processus d’échantillonnage d’un modèle de langage, sans dégrader significativement la qualité du texte. Une expérimentation portant sur près de 20 millions de réponses Gemini avait notamment conclu à une différence négligeable entre les réponses filigranées et non filigranées en matière de qualité perçue.
Le principe est donc assez différent d’un détecteur classique d’IA. Un détecteur tente généralement de deviner, à partir des caractéristiques stylistiques d’un texte, si celui-ci semble avoir été produit par une IA. Le filigrane, lui, repose sur une information introduite au moment de la génération et vérifiable ultérieurement avec une clé. Cette différence est fondamentale.
Il serait toutefois trompeur de présenter cette technologie comme une machine capable de répondre définitivement à la question : « Ce texte a-t-il été écrit par une IA ? » Le filigrane d’Anthropic répond à une question beaucoup plus précise : « Quelle est la probabilité que Claude ait participé à la production de ce texte ? »
Cela signifie qu’il ne permet pas nécessairement de distinguer entre un texte entièrement écrit par Claude et un texte initialement produit par un humain puis substantiellement réécrit par Claude. À l’inverse, une simple correction grammaticale réalisée par Claude pourrait produire trop peu de modifications pour que le filigrane soit statistiquement détectable.
La longueur du texte joue également un rôle. Plus le modèle prend de décisions de génération, plus il existe de possibilités pour le motif statistique de devenir identifiable. Anthropic reconnaît par ailleurs une limite importante : une réécriture complète peut supprimer le filigrane. Si chaque mot est remplacé, le motif introduit lors de la génération originale disparaît. Le filigrane est donc un outil d’attribution probabiliste, pas une preuve absolue d’origine.
Pourquoi l’Europe accélère-t-elle ce mouvement ?
La décision d’Anthropic ne peut pas être comprise indépendamment de l’AI Act. L’article 50 du règlement européen impose des obligations de transparence à certains fournisseurs et déployeurs de systèmes d’IA. Ces obligations visent notamment à permettre aux utilisateurs de savoir lorsqu’ils interagissent avec une IA et à favoriser l’identification des contenus générés ou manipulés artificiellement dans les situations prévues par le règlement. Elles sont applicables depuis le 2 août 2026.
La Commission européenne a parallèlement publié en juin 2026 son Code de bonnes pratiques sur le marquage et l’étiquetage des contenus générés par IA. Celui-ci fournit aux fournisseurs et aux déployeurs des moyens pratiques pour mettre en œuvre ces obligations.
Anthropic explique avoir signé ce code avec d’autres acteurs majeurs de l’IA et avoir choisi, dans un premier temps, d’appliquer mondialement son mécanisme de filigranage plutôt que de limiter son utilisation au marché européen. C’est un point important : une règle européenne commence ainsi à produire des effets techniques au-delà du territoire européen.
Une nouvelle infrastructure de traçabilité de l’IA ?
C’est probablement l’aspect le plus intéressant de cette annonce. L’Europe ne demande pas simplement aux entreprises d’ajouter une petite mention « généré par IA ». Elle pousse progressivement l’industrie vers la création d’une infrastructure technique permettant de déterminer l’origine des contenus.
Anthropic distingue d’ailleurs deux mécanismes. Pour le texte, l’entreprise utilise le filigrane probabiliste. Pour les fichiers générés — notamment certaines images — Claude peut utiliser la norme C2PA, qui permet d’associer aux fichiers des informations cryptographiquement signées sur leur provenance. C2PA est déjà utilisée dans différents secteurs de la création numérique et de la photographie.
On voit donc émerger deux grandes familles de technologies : le marquage intégré au contenu, comme le filigrane textuel et les informations de provenance attachées au fichier, comme C2PA. Dans les deux cas, l’objectif est similaire : rendre l’origine d’un contenu plus vérifiable.
Le filigrane ne dit rien sur l’identité de l’utilisateur
Anthropic insiste sur un autre point qui pourrait susciter des inquiétudes : le filigrane n’est pas un identifiant personnel. Selon l’entreprise, il ne permet pas de retrouver l’utilisateur, son organisation, sa conversation ou son compte. Il permet seulement d’évaluer si Claude a probablement participé à la génération du contenu. Cette distinction est essentielle.
Le dispositif pourrait ainsi permettre à un établissement universitaire, à une plateforme ou à un média de vérifier qu’un texte présente les caractéristiques d’une production Claude sans pour autant avoir accès aux données personnelles de l’utilisateur.
Une protection contre la désinformation… mais pas une solution miracle
Le filigranage répond à une préoccupation devenue centrale : la difficulté croissante de distinguer un contenu humain d’un contenu généré artificiellement.
Dans l’éducation, le journalisme, l’information publique ou les campagnes de désinformation, cette distinction peut avoir des conséquences importantes. Mais il serait dangereux de considérer le filigrane comme une garantie absolue.
Une traduction produite entièrement par Claude pourra être filigranée. Une réécriture humaine complète pourra, elle, faire disparaître le signal. Un texte très court pourra être difficile à identifier. Et un texte produit par un autre modèle ne pourra pas être identifié avec la clé de Claude. Le système répond donc à une question limitée : Claude a-t-il probablement participé à ce contenu ?
Il ne répond pas à la question plus complexe : qui est réellement l’auteur de ce contenu et quelle part de responsabilité humaine ou algorithmique faut-il lui attribuer ?