Skip to main content

Crawlers de IA: quem acessa seu site e o que cada token controla

Todo mecanismo de IA que responde perguntas sobre o seu mercado acessa conteúdo da web, e cada fornecedor publica tokens de user agent que você pode permitir ou bloquear no robots.txt. Os tokens não são intercambiáveis. Alguns alimentam o treinamento de modelos, alguns alimentam o índice de busca a partir do qual um mecanismo cita, e alguns acessam uma página ao vivo porque um usuário acabou de perguntar sobre ela. Bloqueie o errado e você abre mão de visibilidade sem proteger nada.

Três tipos de agentes

A documentação dos fornecedores se separa de forma limpa em três papéis. Crawlers de treinamento coletam conteúdo que pode ser usado para treinar futuros modelos de fundação. Crawlers de busca constroem o índice de recuperação que um mecanismo usa para fundamentar e citar suas respostas. Agentes acionados pelo usuário visitam uma página no momento em que a pergunta de um usuário exige. Apenas o primeiro papel toca em treinamento. Apenas os outros dois decidem se você pode aparecer nas respostas.

OpenAI: GPTBot, OAI-SearchBot e ChatGPT-User

A OpenAI documenta seus bots exatamente nessas linhas. O GPTBot rastreia conteúdo para o treinamento de modelos de fundação de IA generativa, e proibi-lo indica que seu conteúdo não deve ser usado nesse treinamento. O OAI-SearchBot é usado para exibir sites nos recursos de busca do ChatGPT, e a OpenAI afirma que sites que optaram por sair dele não serão mostrados nas respostas de busca do ChatGPT. O ChatGPT-User executa acessos para ações de usuários no ChatGPT e em Custom GPTs; por serem iniciados pelo usuário, a OpenAI observa que as regras do robots.txt podem não se aplicar, e este agente não determina inclusão na busca. O ponto prático: bloquear o GPTBot não remove você da busca do ChatGPT. Bloquear o OAI-SearchBot remove.

Anthropic: ClaudeBot, Claude-SearchBot e Claude-User

A Anthropic documenta três agentes com a mesma divisão de trabalho. O ClaudeBot coleta conteúdo da web que pode contribuir para o treinamento de modelos, e proibi-lo sinaliza que seu material futuro deve ser excluído dos conjuntos de dados de treinamento. O Claude-SearchBot analisa conteúdo para melhorar a relevância e a precisão das respostas de busca; bloqueá-lo pode reduzir sua visibilidade nesses resultados. O Claude-User acessa páginas quando indivíduos fazem perguntas ao Claude, e bloqueá-lo impede que seu conteúdo seja recuperado para a consulta de um usuário.

Perplexity: PerplexityBot e Perplexity-User

A documentação de crawlers da Perplexity afirma que o PerplexityBot existe para exibir e linkar sites nos resultados de busca da Perplexity e não é usado para rastrear conteúdo para modelos de fundação de IA. Bloqueá-lo, portanto, não impede nada do lado do treinamento; só custa a você presença nos resultados da Perplexity. O Perplexity-User dá suporte a ações de usuários e geralmente ignora as regras do robots.txt porque um usuário solicitou o acesso. Ele tampouco é usado para treinamento.

Google: Googlebot e Google-Extended

O Google-Extended é o token mais mal interpretado desta lista. Segundo a documentação de crawlers do Google, ele não é um crawler separado: o rastreamento acontece sob os user agents existentes do Google, e o Google-Extended é um token de robots.txt usado em função de controle. Ele controla se o conteúdo rastreado pode ser usado para treinar futuros modelos Gemini e para fundamentação nos Gemini Apps e no Grounding with Google Search na Vertex AI. O Google afirma explicitamente que ele não afeta a inclusão de um site na Busca do Google e não é um sinal de ranqueamento. Os recursos de IA dentro da Busca são governados pelos controles normais da Busca que se aplicam ao Googlebot, não pelo Google-Extended. Bloquear o Google-Extended mantém seu conteúdo fora do treinamento do Gemini. Bloquear o Googlebot remove você da Busca e de tudo construído sobre ela.

O trade-off, token por token

TokenBloqueá-lo impedeBloqueá-lo custa a você
GPTBotUso do seu conteúdo no treinamento de modelos da OpenAINenhum efeito documentado na busca do ChatGPT
OAI-SearchBotInclusão na busca do ChatGPTSer mostrado nas respostas de busca do ChatGPT
ChatGPT-UserPouco; o robots.txt pode não se aplicar a ações de usuáriosAcessos às suas páginas iniciados por usuários
ClaudeBotUso do seu conteúdo no treinamento de modelos da AnthropicNada documentado do lado da busca
Claude-SearchBotIndexação para as respostas de busca do ClaudeVisibilidade nessas respostas
Claude-UserRecuperação para consultas individuais de usuáriosVisibilidade na busca web direcionada pelo usuário
PerplexityBotNada no treinamento; é um bot de buscaAparecer nos resultados da Perplexity
Google-ExtendedTreinamento do Gemini e os usos de fundamentação listadosNada na Busca do Google, segundo o Google
GooglebotA própria Busca do GoogleVisibilidade na busca e os recursos de IA construídos sobre ela

A forma limpa de decidir: tokens de treinamento são uma escolha de política que você pode fazer para qualquer lado, enquanto tokens de busca e de usuário são uma escolha de receita, porque um mecanismo que não consegue recuperar você não consegue citar você. Verificar se os crawlers de recuperação conseguem de fato alcançar suas páginas pertence ao SEO técnico, e o que eles fazem com o seu conteúdo depois de obtê-lo é coberto em o que é GEO.