Rastreadores de IA: quién accede a tu sitio y qué controla cada token
Todo motor de IA que responde preguntas sobre tu mercado obtiene contenido web, y cada proveedor publica tokens de user agent que puedes permitir o bloquear en robots.txt. Los tokens no son intercambiables. Algunos alimentan el entrenamiento de modelos, otros alimentan el índice de búsqueda desde el que un motor cita, y otros acceden a una página en vivo porque un usuario acaba de preguntar por ella. Bloquea el equivocado y renuncias a visibilidad sin proteger nada.
Tres tipos de agentes
La documentación de los proveedores se separa limpiamente en tres roles. Los rastreadores de entrenamiento recopilan contenido que puede usarse para entrenar futuros modelos fundacionales. Los rastreadores de búsqueda construyen el índice de recuperación que un motor usa para fundamentar y citar sus respuestas. Los agentes activados por usuarios visitan una página en el momento en que la pregunta de un usuario lo requiere. Solo el primer rol toca el entrenamiento. Solo los otros dos deciden si puedes aparecer en respuestas.
OpenAI: GPTBot, OAI-SearchBot y ChatGPT-User
OpenAI documenta sus bots exactamente en estos términos. GPTBot rastrea contenido para entrenar modelos fundacionales de IA generativa, y bloquearlo indica que tu contenido no debe usarse en ese entrenamiento. OAI-SearchBot se usa para mostrar sitios web en las funciones de búsqueda de ChatGPT, y OpenAI afirma que los sitios excluidos de él no se mostrarán en las respuestas de búsqueda de ChatGPT. ChatGPT-User realiza accesos para acciones de usuarios en ChatGPT y los Custom GPTs; como son iniciados por usuarios, OpenAI señala que las reglas de robots.txt pueden no aplicarse, y este agente no determina la inclusión en búsqueda. El punto práctico: bloquear GPTBot no te saca de la búsqueda de ChatGPT. Bloquear OAI-SearchBot sí.
Anthropic: ClaudeBot, Claude-SearchBot y Claude-User
Anthropic documenta tres agentes con la misma división del trabajo. ClaudeBot recopila contenido web que podría contribuir al entrenamiento de modelos, y bloquearlo señala que tu material futuro debe excluirse de los conjuntos de datos de entrenamiento. Claude-SearchBot analiza contenido para mejorar la relevancia y la exactitud de las respuestas de búsqueda; bloquearlo puede reducir tu visibilidad en esos resultados. Claude-User accede a páginas cuando las personas hacen preguntas a Claude, y bloquearlo impide que tu contenido se recupere para la consulta de un usuario.
Perplexity: PerplexityBot y Perplexity-User
La documentación de rastreadores de Perplexity afirma que PerplexityBot existe para mostrar y enlazar sitios web en los resultados de búsqueda de Perplexity y no se usa para rastrear contenido para modelos fundacionales de IA. Bloquearlo, por tanto, no impide nada en el lado del entrenamiento; solo te cuesta presencia en los resultados de Perplexity. Perplexity-User da soporte a acciones de usuarios y generalmente ignora las reglas de robots.txt porque un usuario solicitó el acceso. Tampoco se usa para entrenamiento.
Google: Googlebot y Google-Extended
Google-Extended es el token peor interpretado de esta lista. Según la documentación de rastreadores de Google, no es en absoluto un rastreador separado: el rastreo ocurre bajo los user agents existentes de Google, y Google-Extended es un token de robots.txt usado como mecanismo de control. Controla si el contenido rastreado puede usarse para entrenar futuros modelos Gemini y para el grounding en las Gemini Apps y en Grounding with Google Search en Vertex AI. Google afirma explícitamente que no afecta a la inclusión de un sitio en la Búsqueda de Google y que no es una señal de posicionamiento. Las funciones de IA dentro de la Búsqueda se rigen por los controles normales de Search que se aplican a Googlebot, no por Google-Extended. Bloquear Google-Extended mantiene tu contenido fuera del entrenamiento de Gemini. Bloquear Googlebot te elimina de la Búsqueda y de todo lo construido sobre ella.
La contrapartida, token por token
| Token | Bloquearlo detiene | Bloquearlo te cuesta |
|---|---|---|
| GPTBot | El uso de tu contenido en el entrenamiento de modelos de OpenAI | Ningún efecto documentado en la búsqueda de ChatGPT |
| OAI-SearchBot | La inclusión en la búsqueda de ChatGPT | Aparecer en las respuestas de búsqueda de ChatGPT |
| ChatGPT-User | Poco; robots.txt puede no aplicarse a acciones de usuarios | Los accesos a tus páginas iniciados por usuarios |
| ClaudeBot | El uso de tu contenido en el entrenamiento de modelos de Anthropic | Nada documentado en el lado de búsqueda |
| Claude-SearchBot | La indexación para las respuestas de búsqueda de Claude | La visibilidad en esas respuestas |
| Claude-User | La recuperación para consultas de usuarios individuales | La visibilidad en la búsqueda web dirigida por usuarios |
| PerplexityBot | Nada en entrenamiento; es un bot de búsqueda | Aparecer en los resultados de Perplexity |
| Google-Extended | El entrenamiento de Gemini y los usos de grounding listados | Nada en la Búsqueda de Google, según Google |
| Googlebot | La propia Búsqueda de Google | La visibilidad en búsqueda y las funciones de IA construidas sobre ella |
La forma limpia de decidir: los tokens de entrenamiento son una decisión de política que puedes tomar en cualquier sentido, mientras que los tokens de búsqueda y de usuario son una decisión de ingresos, porque un motor que no puede recuperarte no puede citarte. Verificar que los rastreadores de recuperación realmente pueden alcanzar tus páginas pertenece al SEO técnico, y lo que hacen con tu contenido una vez que lo tienen se cubre en qué es GEO.