Skip to main content

ChatGPT, Perplexity, Gemini, Claude e Copilot: de onde cada mecanismo tira suas respostas

Mecanismos de resposta parecem iguais por fora: uma pergunta entra, uma resposta citada sai. Por baixo, eles diferem de três formas: o índice do qual cada mecanismo recupera, os crawlers que alimentam esse índice e como as citações chegam ao leitor. A maioria das diferenças práticas decorre do índice, porque um mecanismo só pode citar o que seu sistema de recuperação consegue alcançar.

Uma ressalva de saída. Nem todo backend é público. Algumas empresas documentam seu pipeline de recuperação em detalhe, outras documentam apenas seus crawlers. Onde algo não está documentado, esta página diz exatamente isso. A mecânica compartilhada da geração aumentada por recuperação é coberta em como os mecanismos de resposta escolhem suas fontes; esta página é a referência por mecanismo.

ChatGPT

A OpenAI documenta três fetchers: GPTBot coleta conteúdo para treinar modelos de fundação, OAI-SearchBot exibe sites nos recursos de busca do ChatGPT, e ChatGPT-User busca uma página quando a ação de um usuário exige. A alavanca documentada é o OAI-SearchBot: a OpenAI afirma que sites que optarem por sair dele não serão mostrados nas respostas de busca do ChatGPT. Detalhes de tokens e os custos de bloquear são cobertos em crawlers de IA.

O que a OpenAI não documenta é a composição do índice por trás da busca do ChatGPT nem como as fontes são classificadas dentro dele. Alegações de que ela roda sobre algum índice de terceiros em particular não são confirmadas pela OpenAI e devem ser tratadas como não verificadas. A OpenAI também não documenta nenhum relatório de citações voltado a publishers.

Perplexity

A Perplexity documenta dois agentes. O PerplexityBot exibe e linka sites nos resultados de busca da Perplexity e, segundo a documentação, não é usado para rastrear conteúdo para modelos de fundação de IA. O Perplexity-User busca páginas para perguntas de usuários e geralmente ignora o robots.txt porque uma pessoa solicitou a busca. Bloquear o PerplexityBot, portanto, não protege nada do lado do treinamento; apenas remove você dos resultados da Perplexity.

Além dessas descrições de crawler, a Perplexity não documenta publicamente como seu índice de recuperação é montado nem como as fontes são classificadas, e não documenta nenhum relatório de citações voltado a publishers.

Gemini e os recursos de IA do Google

O Google é o mecanismo mais completamente documentado. Seu guia de recursos de IA afirma que AI Overviews e AI Mode usam geração aumentada por recuperação fundamentada nos sistemas centrais de classificação da Busca, recuperando páginas do índice da Busca. O requisito de entrada é clássico: rastreável, indexada, elegível para snippet. As respostas mostram links proeminentes e clicáveis para as páginas de apoio, e o Search Console inclui um relatório de desempenho de IA generativa, a forma de primeira mão de ver esse tráfego.

Do lado dos crawlers, o Googlebot alimenta a Busca e tudo que é construído sobre ela, enquanto Google-Extended é um token de controle de robots.txt que governa o treinamento de modelos Gemini e usos específicos de fundamentação, não a inclusão na Busca. A distinção é comumente mal lida.

Claude

A Anthropic documenta três agentes: ClaudeBot coleta conteúdo da web que pode contribuir para o treinamento de modelos, Claude-SearchBot analisa conteúdo para melhorar a relevância e a precisão das respostas de busca, e Claude-User busca páginas quando indivíduos fazem perguntas ao Claude. A documentação para desenvolvedores da Anthropic afirma que respostas produzidas com busca na web incluem citações das fontes extraídas dos resultados.

O índice por trás dessa busca não está documentado publicamente. O artigo sobre crawlers descreve o que cada agente faz, não de onde vêm os resultados de busca, e a documentação para desenvolvedores não nomeia nenhum provedor de busca nem índice. Qualquer alegação sobre qual índice sustenta a busca na web do Claude é não verificada. A Anthropic não documenta nenhum relatório de citações voltado a publishers.

Microsoft Copilot

O Copilot é o caso mais claro de um mecanismo construído sobre um índice de busca existente. A Microsoft documenta o caminho de recuperação para o Microsoft 365 Copilot e o Copilot Chat: quando a busca na web está habilitada, o Copilot gera uma consulta de busca a partir do prompt do usuário, envia-a ao serviço de busca do Bing e usa os resultados para fundamentar a resposta em dados da web. A visibilidade nessas respostas passa, portanto, pelo índice do Bing e seu crawler, o Bingbot. Como o Copilot pesa ou seleciona entre os resultados do Bing que recebe não está documentado.

Em fevereiro de 2026, o Bing Webmaster Tools adicionou um relatório de AI Performance em prévia pública, cobrindo citações no Microsoft Copilot, em resumos gerados por IA no Bing e em integrações selecionadas de parceiros. Ele mostra quais URLs são citadas, as consultas de fundamentação que as recuperaram e como a atividade de citação muda ao longo do tempo. Isso faz de Google e Microsoft as duas únicas empresas com um relatório de citações de primeira mão; OpenAI, Anthropic e Perplexity não documentam equivalente.

O que isso significa para o seu robots.txt

Os tokens acima se dividem em crawlers de treinamento, crawlers de busca e fetchers acionados por usuários, e bloqueá-los tem consequências diferentes. Bloquear um bot de treinamento como GPTBot ou ClaudeBot é uma escolha de política sem custo documentado nas respostas de nenhum mecanismo. Bloquear um bot de busca como OAI-SearchBot ou PerplexityBot remove você da superfície de citação daquele mecanismo. Os custos e benefícios, token por token, vivem em crawlers de IA.

O trabalho é compartilhado, as superfícies diferem

Nada acima soma cinco disciplinas separadas. Todo mecanismo precisa dos mesmos insumos: páginas que seu crawler consegue alcançar, trechos que declaram uma resposta com clareza suficiente para citar, e conteúdo mantido em dia. Os mecanismos diferem em quanto se apoiam na atualidade: em um estudo de 7.683 páginas e 47.097 citações, o Gemini citou conteúdo atualizado no último ano em 78 por cento das vezes, o ChatGPT em 73 por cento e a Perplexity em 65 por cento. O que atualizar, e com que frequência, é coberto em atualidade.

O que difere é a sua posição por mecanismo, porque os índices diferem. A única forma de saber onde você está é medir por mecanismo, com amostragem repetida em vez de checagens pontuais. Amostre entre idiomas também: em medições de respostas de LLMs sobre marcas, o idioma da consulta explica de 26,5 a 32,0 por cento da variância das respostas, enquanto a identidade da marca explica 1,5 por cento. O que isso significa para os mercados é coberto em GEO multilíngue.

MecanismoCrawlers documentadosBackend de recuperação documentadoRelatório de citações de primeira mão
ChatGPTGPTBot, OAI-SearchBot, ChatGPT-UserUm crawler de busca alimenta a busca do ChatGPT; composição do índice não documentadaNenhum documentado
PerplexityPerplexityBot, Perplexity-UserUm crawler de busca dedicado; detalhes do índice não documentadosNenhum documentado
Gemini e os recursos de IA do GoogleGooglebot, com Google-Extended como token de controleSistemas centrais de classificação da Busca e o índice da BuscaRelatório de desempenho de IA generativa no Search Console
ClaudeClaudeBot, Claude-SearchBot, Claude-UserNão documentadoNenhum documentado
CopilotBingbot, via índice do BingConsultas geradas enviadas ao serviço de busca do BingRelatório de AI Performance no Bing Webmaster Tools (prévia)