ChatGPT, Perplexity, Gemini, Claude et Copilot : où chaque moteur trouve ses réponses
Les moteurs de réponse se ressemblent vus de l'extérieur : une question entre, une réponse citée sort. Dessous, ils diffèrent sur trois points : l'index dont chaque moteur tire ses résultats, les crawlers qui alimentent cet index, et la façon dont les citations parviennent au lecteur. La plupart des différences pratiques découlent de l'index, car un moteur ne peut citer que ce que son système de récupération peut atteindre.
Une réserve d'emblée. Tous les backends ne sont pas publics. Certaines entreprises documentent leur pipeline de récupération en détail, d'autres ne documentent que leurs crawlers. Là où quelque chose n'est pas documenté, cette page le dit exactement. La mécanique commune de la génération augmentée par récupération est traitée dans comment les moteurs de réponse choisissent leurs sources ; cette page est la référence moteur par moteur.
ChatGPT
OpenAI documente trois récupérateurs : GPTBot collecte du contenu pour entraîner des modèles de fondation, OAI-SearchBot fait apparaître des sites web dans les fonctionnalités de recherche de ChatGPT, et ChatGPT-User récupère une page quand l'action d'un utilisateur l'exige. Le levier documenté est OAI-SearchBot : OpenAI indique que les sites qui s'en excluent ne seront pas affichés dans les réponses de recherche de ChatGPT. Les détails des jetons et les compromis liés au blocage sont traités dans crawlers IA.
Ce qu'OpenAI ne documente pas, c'est la composition de l'index derrière la recherche ChatGPT ni la façon dont les sources y sont classées. Les affirmations selon lesquelles elle reposerait sur tel index tiers ne sont pas confirmées par OpenAI et doivent être considérées comme non vérifiées. OpenAI ne documente pas non plus de rapport de citations destiné aux éditeurs.
Perplexity
Perplexity documente deux agents. PerplexityBot fait apparaître et lie des sites web dans les résultats de recherche de Perplexity et, d'après la documentation, n'est pas utilisé pour explorer du contenu destiné aux modèles de fondation d'IA. Perplexity-User récupère des pages pour les questions des utilisateurs et ignore généralement robots.txt parce qu'une personne a demandé la récupération. Bloquer PerplexityBot ne protège donc rien du côté de l'entraînement ; cela vous retire seulement des résultats de Perplexity.
Au-delà de ces descriptions de crawlers, Perplexity ne documente pas publiquement comment son index de récupération est assemblé ni comment les sources sont classées, et il ne documente aucun rapport de citations destiné aux éditeurs.
Gemini et les fonctionnalités IA de Google
Google est le moteur le plus complètement documenté. Son guide des fonctionnalités IA indique qu'AI Overviews et AI Mode utilisent la génération augmentée par récupération ancrée dans les systèmes de classement centraux de Search, en récupérant des pages depuis l'index de Search. La condition d'entrée est classique : explorable, indexée, éligible aux extraits. Les réponses affichent des liens visibles et cliquables vers les pages d'appui, et Search Console inclut un rapport de performance IA générative, le moyen de première main de voir ce trafic.
Du côté des crawlers, Googlebot alimente Search et tout ce qui est bâti dessus, tandis que Google-Extended est un jeton de contrôle robots.txt qui régit l'entraînement des modèles Gemini et certains usages d'ancrage, pas l'inclusion dans Search. La distinction est fréquemment mal lue.
Claude
Anthropic documente trois agents : ClaudeBot collecte du contenu web susceptible de contribuer à l'entraînement des modèles, Claude-SearchBot analyse le contenu pour améliorer la pertinence et l'exactitude des réponses de recherche, et Claude-User récupère des pages quand des personnes posent des questions à Claude. La documentation développeur d'Anthropic indique que les réponses produites avec la recherche web incluent des citations pour les sources tirées des résultats.
L'index derrière cette recherche n'est pas documenté publiquement. L'article sur les crawlers décrit ce que fait chaque agent, pas d'où viennent les résultats de recherche, et la documentation développeur ne nomme aucun fournisseur de recherche ni aucun index. Toute affirmation sur l'index qui alimente la recherche web de Claude est non vérifiée. Anthropic ne documente aucun rapport de citations destiné aux éditeurs.
Microsoft Copilot
Copilot est le cas le plus net d'un moteur bâti sur un index de recherche existant. Microsoft documente le chemin de récupération pour Microsoft 365 Copilot et Copilot Chat : quand la recherche web est activée, Copilot génère une requête de recherche à partir du prompt de l'utilisateur, l'envoie au service de recherche Bing, et utilise les résultats pour ancrer la réponse dans des données du web. La visibilité dans ces réponses passe donc par l'index de Bing et son crawler, Bingbot. La façon dont Copilot pondère ou sélectionne parmi les résultats Bing qu'il reçoit n'est pas documentée.
En février 2026, Bing Webmaster Tools a ajouté un rapport AI Performance en préversion publique, couvrant les citations dans Microsoft Copilot, les résumés générés par IA dans Bing et certaines intégrations partenaires. Il montre quelles URL sont citées, les requêtes d'ancrage qui les ont récupérées, et comment l'activité de citation évolue dans le temps. Cela fait de Google et Microsoft les deux seules entreprises à proposer un rapport de citations de première main ; OpenAI, Anthropic et Perplexity n'en documentent aucun équivalent.
Ce que cela signifie pour votre robots.txt
Les jetons ci-dessus se répartissent en crawlers d'entraînement, crawlers de recherche et récupérateurs déclenchés par l'utilisateur, et les bloquer a des conséquences différentes. Bloquer un bot d'entraînement comme GPTBot ou ClaudeBot est un choix de politique sans coût documenté dans les réponses d'aucun moteur. Bloquer un bot de recherche comme OAI-SearchBot ou PerplexityBot vous retire de la surface de citation de ce moteur. Les compromis, jeton par jeton, sont dans crawlers IA.
Le travail est commun, les surfaces diffèrent
Rien de ce qui précède ne fait cinq disciplines distinctes. Chaque moteur a besoin des mêmes entrées : des pages que son crawler peut atteindre, des passages qui énoncent une réponse assez clairement pour être cités, et un contenu maintenu à jour. Les moteurs diffèrent par le poids qu'ils accordent à la fraîcheur : dans une étude de 7 683 pages et 47 097 citations, Gemini citait du contenu mis à jour au cours de l'année écoulée dans 78 pour cent des cas, ChatGPT dans 73 pour cent et Perplexity dans 65 pour cent. Quoi mettre à jour, et à quelle fréquence, est traité dans fraîcheur.
Ce qui diffère, c'est votre position moteur par moteur, parce que les index diffèrent. Le seul moyen de savoir où vous en êtes est de mesurer par moteur, avec un échantillonnage répété plutôt que des contrôles ponctuels. Échantillonnez aussi à travers les langues : dans les mesures des réponses des LLM au sujet des marques, la langue de la requête explique de 26,5 à 32,0 pour cent de la variance des réponses, tandis que l'identité de la marque en explique 1,5 pour cent. Ce que cela signifie pour les marchés est traité dans GEO multilingue.
| Moteur | Crawlers documentés | Backend de récupération documenté | Rapport de citations de première main |
|---|---|---|---|
| ChatGPT | GPTBot, OAI-SearchBot, ChatGPT-User | Un crawler de recherche alimente la recherche ChatGPT ; composition de l'index non documentée | Aucun documenté |
| Perplexity | PerplexityBot, Perplexity-User | Un crawler de recherche dédié ; détails de l'index non documentés | Aucun documenté |
| Gemini et les fonctionnalités IA de Google | Googlebot, avec Google-Extended comme jeton de contrôle | Systèmes de classement centraux de Search et index de Search | Rapport de performance IA générative dans Search Console |
| Claude | ClaudeBot, Claude-SearchBot, Claude-User | Non documenté | Aucun documenté |
| Copilot | Bingbot, via l'index de Bing | Requêtes générées envoyées au service de recherche Bing | Rapport AI Performance dans Bing Webmaster Tools (préversion) |