Crawlers IA : qui récupère votre site et ce que contrôle chaque jeton
Chaque moteur IA qui répond à des questions sur votre marché récupère du contenu web, et chaque éditeur publie des jetons user agent que vous pouvez autoriser ou bloquer dans robots.txt. Les jetons ne sont pas interchangeables. Certains alimentent l'entraînement des modèles, certains alimentent l'index de recherche à partir duquel un moteur cite, et certains récupèrent une page en direct parce qu'un utilisateur vient de poser une question. Bloquez le mauvais et vous renoncez à de la visibilité sans rien protéger.
Trois types de récupérateurs
La documentation des éditeurs se divise nettement en trois rôles. Les crawlers d'entraînement collectent du contenu susceptible de servir à entraîner de futurs modèles de fondation. Les crawlers de recherche construisent l'index de récupération qu'un moteur utilise pour ancrer et citer ses réponses. Les récupérateurs déclenchés par l'utilisateur visitent une page au moment où la question d'un utilisateur l'exige. Seul le premier rôle touche à l'entraînement. Seuls les deux autres décident si vous pouvez apparaître dans les réponses.
OpenAI : GPTBot, OAI-SearchBot et ChatGPT-User
OpenAI documente ses bots exactement selon ces lignes. GPTBot explore du contenu pour entraîner des modèles de fondation d'IA générative, et l'interdire indique que votre contenu ne doit pas être utilisé dans cet entraînement. OAI-SearchBot sert à faire apparaître des sites web dans les fonctionnalités de recherche de ChatGPT, et OpenAI indique que les sites qui s'en excluent ne seront pas affichés dans les réponses de recherche de ChatGPT. ChatGPT-User effectue des récupérations pour les actions des utilisateurs dans ChatGPT et les GPT personnalisés ; comme elles sont initiées par l'utilisateur, OpenAI note que les règles robots.txt peuvent ne pas s'appliquer, et cet agent ne détermine pas l'inclusion dans la recherche. Le point pratique : bloquer GPTBot ne vous retire pas de la recherche ChatGPT. Bloquer OAI-SearchBot, si.
Anthropic : ClaudeBot, Claude-SearchBot et Claude-User
Anthropic documente trois agents avec la même division du travail. ClaudeBot collecte du contenu web susceptible de contribuer à l'entraînement des modèles, et l'interdire signale que vos futurs contenus doivent être exclus des jeux de données d'entraînement. Claude-SearchBot analyse le contenu pour améliorer la pertinence et l'exactitude des réponses de recherche ; le bloquer peut réduire votre visibilité dans ces résultats. Claude-User récupère des pages quand des personnes posent des questions à Claude, et le bloquer empêche votre contenu d'être récupéré pour la requête d'un utilisateur.
Perplexity : PerplexityBot et Perplexity-User
La documentation des crawlers de Perplexity indique que PerplexityBot existe pour faire apparaître et lier des sites web dans les résultats de recherche de Perplexity et qu'il n'est pas utilisé pour explorer du contenu destiné aux modèles de fondation d'IA. Le bloquer n'empêche donc rien du côté de l'entraînement ; cela vous coûte seulement votre présence dans les résultats de Perplexity. Perplexity-User prend en charge les actions des utilisateurs et ignore généralement les règles robots.txt parce qu'un utilisateur a demandé la récupération. Il n'est pas non plus utilisé pour l'entraînement.
Google : Googlebot et Google-Extended
Google-Extended est le jeton le plus mal lu de cette liste. D'après la documentation des crawlers de Google, ce n'est pas du tout un crawler distinct : l'exploration se fait sous les user agents Google existants, et Google-Extended est un jeton robots.txt utilisé à titre de contrôle. Il détermine si le contenu exploré peut servir à entraîner de futurs modèles Gemini et à l'ancrage dans les applications Gemini et dans Grounding with Google Search sur Vertex AI. Google indique explicitement qu'il n'affecte pas l'inclusion d'un site dans Google Search et qu'il n'est pas un signal de classement. Les fonctionnalités IA au sein de Search sont régies par les contrôles Search habituels qui s'appliquent à Googlebot, et non par Google-Extended. Bloquer Google-Extended tient votre contenu à l'écart de l'entraînement de Gemini. Bloquer Googlebot vous retire de Search et de tout ce qui est bâti dessus.
Le compromis, jeton par jeton
| Jeton | Le bloquer empêche | Le bloquer vous coûte |
|---|---|---|
| GPTBot | L'utilisation de votre contenu pour l'entraînement des modèles OpenAI | Aucun effet documenté sur la recherche ChatGPT |
| OAI-SearchBot | L'inclusion dans la recherche ChatGPT | D'être affiché dans les réponses de recherche ChatGPT |
| ChatGPT-User | Peu de chose ; robots.txt peut ne pas s'appliquer aux actions des utilisateurs | Les récupérations de vos pages initiées par les utilisateurs |
| ClaudeBot | L'utilisation de votre contenu pour l'entraînement des modèles Anthropic | Rien de documenté du côté de la recherche |
| Claude-SearchBot | L'indexation pour les réponses de recherche de Claude | La visibilité dans ces réponses |
| Claude-User | La récupération pour les requêtes individuelles des utilisateurs | La visibilité dans la recherche web dirigée par l'utilisateur |
| PerplexityBot | Rien côté entraînement ; c'est un bot de recherche | D'apparaître dans les résultats de Perplexity |
| Google-Extended | L'entraînement de Gemini et les usages d'ancrage listés | Rien dans Google Search, selon Google |
| Googlebot | Google Search lui-même | La visibilité dans Search et les fonctionnalités IA bâties dessus |
La façon nette de trancher : les jetons d'entraînement relèvent d'un choix de politique que vous pouvez faire dans un sens comme dans l'autre, tandis que les jetons de recherche et d'utilisateur relèvent d'un choix de chiffre d'affaires, car un moteur qui ne peut pas vous récupérer ne peut pas vous citer. Vérifier que les crawlers de récupération atteignent bien vos pages relève du SEO technique, et ce qu'ils font de votre contenu une fois qu'ils l'ont est traité dans qu'est-ce que le GEO.