Comprendre le facteur « Content Signals (search, ai-input, ai-train) »
Les signaux de contenu (Content Signals) sont des préférences lisibles par les machines proposées sur la manière dont le contenu d'un site peut être utilisé. search couvre la création d'un index de recherche et l'affichage de liens ou de courts extraits ; la proposition indique qu'elle ne couvre pas les résumés de recherche générés par l'IA. ai-input couvre l'utilisation du contenu comme entrée dans les réponses IA en temps réel, y compris la récupération et le grounding. ai-train couvre l’entraînement ou le réglage du modèle. Un site peut exprimer ces préférences via les directives Content-Signal dans robots.txt, et certains services peuvent également émettre un en-tête de réponse Content-Signal. Les signaux indiquent une politique d'utilisation prévue ; ils n'arrêtent pas techniquement l'accès.
Détails de l’impact
Impact : inconnu et dépendant du client. Un client qui honore le signal peut modifier la façon dont il utilise le contenu. En particulier, ai-input=no exprime une préférence contre l’utilisation du contenu dans les réponses IA en temps réel et pourrait réduire l’inclusion des réponses IA là où elle est honorée. search=yes autorise l'utilisation de la recherche définie par cette proposition, et non les résumés générés par l'IA. Un client qui ignore ou ne prend pas en charge les signaux de contenu peut ne pas modifier son comportement. Il n'y a aucune bonne raison de traiter les valeurs yes comme des améliorations de classement ou de recommander des valeurs permissives uniquement pour la visibilité. Décidez des paramètres en fonction de la politique d'utilisation du contenu de l'éditeur et des compromis attendus. La proposition de signaux de contenu et la documentation Markdown for Agents de Cloudflare.
Détails des preuves et du consensus
Preuve : Faible. Consensus : mitigé pour les effets de visibilité dans les IA multiplateforme. La proposition définit les trois signaux et reconnaît explicitement que les robots peuvent les ignorer. Cloudflare documente que son endpoint d’exploration Browser Run respecte les signaux de contenu, montrant une implémentation concrète qui les respecte. Cela n’établit pas l’adoption par Google, OpenAI ou tous les robots. Google documente ses propres contrôles d'exploration et d'extraits de recherche pour les fonctionnalités d'IA ; OpenAI documente des contrôles robots.txt distincts pour OAI-SearchBot et GPTBot. Il ne faut pas supposer que ces contrôles de fournisseur interprètent Content-Signal. Aucune mesure générale ne démontre que l’ajout de ces directives augmente les citations d’IA. La proposition de signaux de contenu, la documentation sur les endpoints d’exploration de Cloudflare, les conseils sur les fonctionnalités d'IA de Google et la documentation du robot d'exploration d'OpenAI.
Recommandation
Définissez les signaux de contenu uniquement après avoir décidé quelles utilisations vous souhaitez autoriser. Enregistrez les valeurs search, ai-input et ai-train souhaitées, appliquez-les à la bonne portée et inspectez la réponse réelle fournie aux clients. Gardez ces préférences cohérentes avec les règles du robot d'exploration spécifiques à votre fournisseur et les autres politiques publiées. Un signal manquant n'est pas la même chose qu'un yes ou un no explicite dans la proposition. Si un service transforme HTML en Markdown, inspectez également tout en-tête de réponse Content-Signal sur cette représentation. Revisitez les paramètres lorsque la proposition ou le support d'un client cible change. La proposition Content Signals et la documentation Markdown for Agents de Cloudflare.
Plateformes IA
Google AI Overviews et AI Mode : Google décrit les contrôles d'accès et d'extraits Googlebot pour ses fonctionnalités d'IA, sans documenter les signaux de contenu en tant que contrôle. Conseils sur les fonctionnalités d'IA de Google.
Entraînement ChatGPT et OpenAI : OpenAI documente séparément les contrôles robots.txt OAI-SearchBot et GPTBot, sans documenter la prise en charge des signaux de contenu. Documentation du robot d'exploration d'OpenAI.
Gemini : Google documente Google-Extended comme contrôle pour les usages spécifiés d’entraînement de Gemini et les utilisations de grounding. Ce jeton de produit est distinct des directives proposées sur les signaux de contenu. Référence du robot d'exploration de Google.
Claude : Anthropic documente les identités des robots d'exploration et les contrôles robots.txt distincts pour la recherche, les demandes des utilisateurs et l’entraînement ; il ne documente pas la prise en charge de ces directives Content Signals. Documentation du robot d'exploration d’Anthropic.
Cloudflare Browser Run crawl : son endpoint d’exploration documenté respecte les signaux de contenu. Appliquez les contrôles documentés de chaque plateforme lorsque cette plateforme est importante pour votre politique ; ne présumez pas qu’un signal a le même effet partout. Documentation des endpoints d’exploration de Cloudflare.
Instructions d’audit
- Ouvrez le fichier
/robots.txten direct et vérifiez les règlesContent-Signal. Demandez quelques pages importantes et inspectez tous les en-têtes de réponseContent-Signal, y compris sur les versions Markdown si elles sont proposées. - Enregistrez les valeurs effectives
search,ai-inputetai-trainpour ces pages. Comparez-les avec la politique que vous envisagez et avec les règles de robot d'exploration spécifiques au fournisseur ; corrigez les directives manquantes, contradictoires ou trop larges. - Pour un client connu pour honorer les signaux de contenu, vérifiez son comportement documenté et surveillez les requêtes ou l’utilisation dans les réponses après une modification. Revérifiez régulièrement les directives servies ; les paramètres expriment des préférences, et non un changement garanti dans les citations.