Skip to main content

Last updated

Crawlers IA : qui récupère votre site et ce que contrôle chaque jeton

Chaque moteur IA qui répond à des questions sur votre marché récupère du contenu web, et chaque éditeur publie des jetons user agent que vous pouvez autoriser ou bloquer dans robots.txt. Les jetons ne sont pas interchangeables. Certains alimentent l'entraînement des modèles, certains alimentent l'index de recherche à partir duquel un moteur cite, et certains récupèrent une page en direct parce qu'un utilisateur vient de poser une question. Bloquez le mauvais et vous renoncez à de la visibilité sans rien protéger.

Trois types de récupérateurs

La documentation des éditeurs se divise nettement en trois rôles. Les crawlers d'entraînement collectent du contenu susceptible de servir à entraîner de futurs modèles de fondation. Les crawlers de recherche construisent l'index de récupération qu'un moteur utilise pour ancrer et citer ses réponses. Les récupérateurs déclenchés par l'utilisateur visitent une page au moment où la question d'un utilisateur l'exige. Seul le premier rôle touche à l'entraînement. Seuls les deux autres décident si vous pouvez apparaître dans les réponses.

OpenAI : GPTBot, OAI-SearchBot et ChatGPT-User

OpenAI documente ses bots exactement selon ces lignes. GPTBot explore du contenu pour entraîner des modèles de fondation d'IA générative, et l'interdire indique que votre contenu ne doit pas être utilisé dans cet entraînement. OAI-SearchBot sert à faire apparaître des sites web dans les fonctionnalités de recherche de ChatGPT, et OpenAI indique que les sites qui s'en excluent ne seront pas affichés dans les réponses de recherche de ChatGPT. ChatGPT-User effectue des récupérations pour les actions des utilisateurs dans ChatGPT et les GPT personnalisés ; comme elles sont initiées par l'utilisateur, OpenAI note que les règles robots.txt peuvent ne pas s'appliquer, et cet agent ne détermine pas l'inclusion dans la recherche. Le point pratique : bloquer GPTBot ne vous retire pas de la recherche ChatGPT. Bloquer OAI-SearchBot, si.

Anthropic : ClaudeBot, Claude-SearchBot et Claude-User

Anthropic documente trois agents avec la même division du travail. ClaudeBot collecte du contenu web susceptible de contribuer à l'entraînement des modèles, et l'interdire signale que vos futurs contenus doivent être exclus des jeux de données d'entraînement. Claude-SearchBot analyse le contenu pour améliorer la pertinence et l'exactitude des réponses de recherche ; le bloquer peut réduire votre visibilité dans ces résultats. Claude-User récupère des pages quand des personnes posent des questions à Claude, et le bloquer empêche votre contenu d'être récupéré pour la requête d'un utilisateur.

Perplexity : PerplexityBot et Perplexity-User

La documentation des crawlers de Perplexity indique que PerplexityBot existe pour faire apparaître et lier des sites web dans les résultats de recherche de Perplexity et qu'il n'est pas utilisé pour explorer du contenu destiné aux modèles de fondation d'IA. Le bloquer n'empêche donc rien du côté de l'entraînement ; cela vous coûte seulement votre présence dans les résultats de Perplexity. Perplexity-User prend en charge les actions des utilisateurs et ignore généralement les règles robots.txt parce qu'un utilisateur a demandé la récupération. Il n'est pas non plus utilisé pour l'entraînement.

Google : Googlebot et Google-Extended

Google-Extended est le jeton le plus mal lu de cette liste. D'après la documentation des crawlers de Google, ce n'est pas du tout un crawler distinct : l'exploration se fait sous les user agents Google existants, et Google-Extended est un jeton robots.txt utilisé à titre de contrôle. Il détermine si le contenu exploré peut servir à entraîner de futurs modèles Gemini et à l'ancrage dans les applications Gemini et dans Grounding with Google Search sur Vertex AI. Google indique explicitement qu'il n'affecte pas l'inclusion d'un site dans Google Search et qu'il n'est pas un signal de classement. Les fonctionnalités IA au sein de Search sont régies par les contrôles Search habituels qui s'appliquent à Googlebot, et non par Google-Extended. Bloquer Google-Extended tient votre contenu à l'écart de l'entraînement de Gemini. Bloquer Googlebot vous retire de Search et de tout ce qui est bâti dessus.

Le compromis, jeton par jeton

JetonLe bloquer empêcheLe bloquer vous coûte
GPTBotL'utilisation de votre contenu pour l'entraînement des modèles OpenAIAucun effet documenté sur la recherche ChatGPT
OAI-SearchBotL'inclusion dans la recherche ChatGPTD'être affiché dans les réponses de recherche ChatGPT
ChatGPT-UserPeu de chose ; robots.txt peut ne pas s'appliquer aux actions des utilisateursLes récupérations de vos pages initiées par les utilisateurs
ClaudeBotL'utilisation de votre contenu pour l'entraînement des modèles AnthropicRien de documenté du côté de la recherche
Claude-SearchBotL'indexation pour les réponses de recherche de ClaudeLa visibilité dans ces réponses
Claude-UserLa récupération pour les requêtes individuelles des utilisateursLa visibilité dans la recherche web dirigée par l'utilisateur
PerplexityBotRien côté entraînement ; c'est un bot de rechercheD'apparaître dans les résultats de Perplexity
Google-ExtendedL'entraînement de Gemini et les usages d'ancrage listésRien dans Google Search, selon Google
GooglebotGoogle Search lui-mêmeLa visibilité dans Search et les fonctionnalités IA bâties dessus

La façon nette de trancher : les jetons d'entraînement relèvent d'un choix de politique que vous pouvez faire dans un sens comme dans l'autre, tandis que les jetons de recherche et d'utilisateur relèvent d'un choix de chiffre d'affaires, car un moteur qui ne peut pas vous récupérer ne peut pas vous citer. Vérifier que les crawlers de récupération atteignent bien vos pages relève du SEO technique, et ce qu'ils font de votre contenu une fois qu'ils l'ont est traité dans qu'est-ce que le GEO.

Passez en pilote automatique

Vupie applique tout ce guide, huit articles premium par mois.

Rejoindre la bêta