Comment détecter le filigrane de Claude (et pourquoi un résultat négatif ne prouve rien)

Les manifestes C2PA de Claude peuvent être vérifiés dès maintenant avec c2patool ou la page Content Credentials. Son filigrane textuel intégré ne peut pas être lu par quiconque en dehors d'Anthropic pour l'instant. De plus, l'asymétrie qui rend un résultat de détection négatif inutile.

Ashley Innocent

Ashley Innocent

11 August 2026

Comment détecter le filigrane de Claude (et pourquoi un résultat négatif ne prouve rien)

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Anthropic intègre désormais une marque lisible par machine dans la sortie de Claude. La question suivante évidente est de savoir comment la détecter. La réponse honnête, à compter d'août 2026, est qu'Anthropic s'est engagé à prendre en charge la détection mais n'a pas encore publié les outils. Son centre d'aide indique que la documentation technique est à venir.

Cette lacune est importante, car la demande pour un détecteur Claude est déjà là et l'offre est un champ de classificateurs tiers qui devinent. Ce sont deux choses complètement différentes, et les confondre, c'est ainsi qu'un étudiant se fait accuser de tricherie pour une phrase qu'il a écrite lui-même.

Cet article couvre ce que signifie réellement la détection pour les deux techniques de marquage de Claude, ce que vous pouvez vérifier aujourd'hui et l'erreur de raisonnement qui rend la plupart des flux de travail de détection dangereux. Si vous intégrez des vérifications de provenance dans une API, Apidog est l'endroit où vous pouvez transformer ces vérifications en assertions qui s'exécutent à chaque build.

Deux marques, deux histoires de détection

Claude marque le contenu de deux manières, et elles ne se ressemblent en rien.

Filigrane textuel intégré Métadonnées C2PA signées
Ce que c'est Un signal statistique tissé dans le texte généré Un manifeste signé cryptographiquement attaché à un fichier
S'applique à Tout texte généré Types de fichiers pris en charge : .svg, .png, .jpg
Survit au copier-coller Oui Non, le fichier est le conteneur
Survit au ré-encodage Oui, le texte est du texte Non, généralement supprimé
Détectable aujourd'hui Pas publiquement. Le support de détection est promis Oui, avec les outils C2PA standard
Vous indique Le contenu a pu être traité par Claude Un fichier a été traité par Claude, et s'il a été altéré

Le filigrane textuel est le plus durable et celui que vous ne pouvez pas lire actuellement. Le manifeste C2PA est le plus fragile et celui que vous pouvez lire dès maintenant avec des outils prêts à l'emploi.

Ce que vous pouvez vérifier aujourd'hui : les manifestes C2PA

Si Claude a produit une image ou un SVG et que rien en aval n'a réécrit les octets, le manifeste se trouve dans le fichier. Trois façons de l'examiner.

Dans un navigateur. Déposez le fichier sur la page de vérification des Content Credentials. Il lit le manifeste et indique le signataire, la revendication et si la signature est valide.

Depuis la ligne de commande. c2patool est l'interface de ligne de commande de référence du projet C2PA :

# Lire le résumé du manifeste
c2patool report.png

# Détail complet au niveau JUMBF, utile pour le débogage d'un pipeline
c2patool report.png -d

Un fichier avec un manifeste intact renvoie une structure JSON décrivant le générateur de revendication, les assertions et l'état de la signature. Un fichier dont le manifeste a été supprimé ne renvoie rien du tout. Un fichier dont les octets ont été altérés sans nouvelle signature renvoie une erreur de validation, ce qui est le cas intermédiaire utile : il distingue « aucune provenance » de « provenance brisée ».

Depuis votre propre code. Les bibliothèques c2pa encapsulent la même logique pour Rust, Python, JavaScript et C, vous pouvez donc exécuter la vérification à l'intérieur d'un gestionnaire de requêtes ou d'un test. C'est l'approche derrière la construction d'une API de détection d'images IA avec C2PA et un classificateur, où le manifeste vous donne une réponse fiable lorsqu'il est présent et le classificateur prend le relais lorsqu'il ne l'est pas.

Ce que vous ne pouvez pas vérifier aujourd'hui : le filigrane textuel

Il n'existe pas de lecteur public pour le filigrane textuel intégré de Claude. Anthropic a déclaré qu'il prendra en charge les utilisateurs et les tiers dans la détection de ses marques, comme l'exige le Code de Conduite, et que des détails seront fournis dans de futures documentations techniques. En attendant :

Considérez cela comme un « pas encore », pas un « jamais ». Lorsque Anthropic publiera le mécanisme de détection, le modèle sensé est une vérification côté serveur que vous appelez depuis votre propre service, exactement comme une étape de vérification C2PA, le résultat étant stocké comme un signal plutôt qu'un verdict.

En revanche, Google a pris la voie opposée avec SynthID Text : il a rendu l'implémentation open source avec un détecteur de référence, afin que n'importe qui puisse l'exécuter sans demander d'accès. C'est le seul schéma de marquage de texte qu'un tiers peut vérifier aujourd'hui, et la différence est expliquée dans Claude vs ChatGPT vs Gemini watermarking.

L'erreur de raisonnement qui compromet les flux de travail de détection

La détection produit un résultat asymétrique. La plupart des gens l'utilisent symétriquement, et c'est là que le problème survient.

Une marque détectée est une preuve positive faible. Elle indique que le contenu a pu être traité par Claude. Elle n'établit pas la paternité, car les gens utilisent couramment Claude pour relire, traduire, résumer et convertir des travaux existants. Un brouillon de 3 000 mots d'un chercheur, passé par Claude pour une correction grammaticale, revient marqué. Les idées et les rapports sont entièrement humains. La marque ne peut pas distinguer cela d'une instruction disant « écrivez-moi 3 000 mots ».

Le contenu change également après être passé par Claude. Le texte marqué est modifié, cité et fusionné dans des documents plus volumineux. Trouver une marque dans un fichier vous indique que quelque chose a touché une partie de celui-ci à un moment donné.

L'absence de marque détectée n'est pas une preuve de quoi que ce soit. Anthropic énumère clairement les cas. Le contenu généré par Claude peut ne porter aucune marque détectable s'il provient d'un modèle publié avant la prise en charge du marquage, si le texte a été fortement modifié, paraphrasé, traduit ou intégré à d'autres écrits, si le passage est trop court pour contenir un signal fiable, si les métadonnées d'un fichier ont été supprimées par une conversion de format, une nouvelle sauvegarde ou une capture d'écran, ou s'il provient d'une plateforme ou d'un type de fichier où ce type de marquage n'est pas pris en charge.

Lisez cette liste et remarquez à quel point chaque élément est ordinaire. Une réponse courte. Un paragraphe traduit. Une capture d'écran d'un graphique. Aucun de ces éléments n'est une évasion ; c'est le quotidien.

La règle est donc la suivante : un résultat positif affine les choses, un résultat négatif ne vous dit rien du tout. Toute politique qui pénalise des personnes sur la base d'un résultat négatif est erronée sur le plan technologique, avant même de se demander si elle est juste. La même asymétrie a déjà causé des problèmes dans le travail d'image, ce qui est l'argument dans pourquoi la détection d'images IA échoue.

Intégrer correctement la détection dans un service

Si vous ajoutez des vérifications de provenance à un produit, les questions de conception portent moins sur l'algorithme et plus sur ce que vous faites d'un signal faible.

Retournez un signal, pas un verdict. Un corps de réponse qui dit {"ai_generated": true} est une affirmation que votre API ne peut pas soutenir. Une réponse qui dit {"provenance": {"c2pa": "verified", "signer": "...", "checked_at": "..."}} est un fait que vous pouvez défendre. Modélisez votre schéma autour de ce que vous avez réellement observé.

Enregistrez ce que vous avez vérifié et quand. Les résultats de provenance deviennent obsolètes, les outils changent et les listes de confiance sont mises à jour. Stockez le résultat de la vérification avec un horodatage et la version de l'outil, de la même manière que vous stockeriez le résultat d'une analyse antivirus.

Séparez « absent » de « brisé ». Ce sont des états différents avec des significations différentes. Absent signifie qu'aucun manifeste n'a été trouvé, ce qui n'est pas informatif. Brisé signifie qu'un manifeste existe mais échoue à la validation, ce qui est vraiment intéressant. Les regrouper en un seul booléen jette votre meilleur signal.

Faites en sorte que l'échec porte sur la vérification, pas sur le contenu. Un service de vérification hors service ne devrait pas marquer silencieusement tout comme non vérifié sans laisser de trace. Mettez en évidence la différence entre « vérifié et rien trouvé » et « n'a pas pu être vérifié ».

Une structure minimale qui tient la route :

{
  "asset_id": "img_9f2c41",
  "provenance": {
    "status": "verified",
    "standard": "c2pa",
    "signer": "Anthropic",
    "signature_valid": true,
    "checked_at": "2026-08-11T09:14:22Z",
    "tool": "c2patool/0.9"
  },
  "notes": "La provenance indique que le fichier a été traité par Claude. Elle n'établit pas la paternité."
}

Ce dernier champ n'est pas décoratif. Si votre API renvoie des données de provenance au code d'une autre équipe, la mise en garde doit être visible par leur code, et non dans une page de documentation que personne ne lit.

Tester les vérifications pour qu'elles continuent de fonctionner

La vérification de la provenance est exactement le genre de fonctionnalité qui tombe en panne silencieusement. Quelqu'un ajoute une étape de redimensionnement d'image, le manifeste disparaît, et chaque ressource commence à revenir avec le statut status: "absent". Rien ne signale d'erreur. Le tableau de bord semble correct.

Quatre assertions à inclure dans un scénario de test :

  1. Un fichier de test valide se vérifie. Téléchargez un fichier avec un manifeste valide, affirmez que status est verified et que signature_valid est true.
  2. Un fichier de test dont les métadonnées ont été supprimées signale l'absence. Téléchargez le même fichier avec les métadonnées supprimées, affirmez que status est absent, sans erreur et non verified.
  3. Un fichier de test altéré signale un défaut. Modifiez un octet dans un fichier signé, affirmez que la réponse distingue brisé d'absent.
  4. L'aller-retour préserve le manifeste. Téléchargez un fichier signé, récupérez-le via votre chemin de livraison normal, et affirmez que le manifeste est toujours valide. C'est celui qui détecte les régressions liées aux CDN et au redimensionnement, couvert en détail dans votre API supprime les métadonnées C2PA.

Dans Apidog, vous pouvez conserver ces quatre éléments comme scénario de test avec des fixtures de fichiers binaires, affirmer sur la réponse JSON avec des assertions standard, et exécuter le scénario depuis apidog-cli en CI afin qu'un changement de pipeline qui consomme les manifestes fasse échouer la build. Le configurer à côté de votre suite existante est le même flux que l'automatisation des tests d'API dans GitHub Actions. Téléchargez Apidog pour le créer contre vos propres points de terminaison.

FAQ

Existe-t-il un détecteur de filigrane officiel pour Claude ? Pas publiquement, à compter d'août 2026. Anthropic s'est engagé à prendre en charge la détection pour les utilisateurs et les tiers et déclare qu'il partagera les détails dans une prochaine documentation technique.

Puis-je utiliser un détecteur de texte IA pour trouver le filigrane de Claude ? Non. Ces outils sont des classificateurs statistiques entraînés à deviner si un texte semble écrit par une machine. Ils ne lisent pas la marque d'Anthropic, et leurs faux positifs affectent le plus durement les auteurs ayant un style inhabituel ou très formel.

Comment vérifier les métadonnées C2PA de Claude dans un fichier ? Exécutez c2patool <fichier> localement, ou déposez le fichier sur la page de vérification des Content Credentials. Les deux signalent le signataire et si la signature est valide.

Si un fichier n'a pas de manifeste C2PA, a-t-il été créé par un humain ? Non. Les manifestes sont régulièrement détruits par le redimensionnement, le ré-encodage, la conversion de format, les captures d'écran et les CDN d'images. L'absence ne prouve rien sur l'origine.

Le filigrane textuel survit-il à l'édition ? Partiellement. Il est transmis par copier-coller et peut persister après certaines modifications, mais une forte paraphrase, une traduction ou une réduction à un très court extrait peuvent le faire passer sous le seuil de détection. Les détails se trouvent dans le filigrane de Claude survit-il au copier-coller et à l'édition.

Que dois-je faire en attendant la publication de la détection ? Vérifiez le C2PA lorsque des fichiers sont impliqués, enregistrez ce que vous avez vérifié, et évitez de créer toute politique qui dépend de la détection de texte. Concevez l'interface dès maintenant afin de pouvoir intégrer ultérieurement une vérification de texte officielle sans modifier votre schéma de réponse.

À retenir

Actuellement, vous pouvez vérifier la provenance des fichiers de Claude avec les outils C2PA standard et vous ne pouvez pas vérifier son filigrane textuel du tout. C'est un état temporaire, mais cela devrait façonner ce que vous construisez aujourd'hui : la vérification des fichiers, des signaux honnêtes plutôt que des verdicts, et aucune politique qui traite un résultat propre comme preuve de quoi que ce soit.

La marque est un indice sur le parcours du contenu. Quiconque la vend comme un test de paternité décrit un produit qui n'existe pas.

bouton

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API