ChatGPT, Perplexity, Gemini, Claude y Copilot: de dónde obtiene sus respuestas cada motor
Los motores de respuestas se parecen desde fuera: entra una pregunta, sale una respuesta con citas. Por debajo difieren en tres cosas: el índice del que recupera cada motor, los rastreadores que alimentan ese índice y cómo llegan las citas al lector. La mayoría de las diferencias prácticas se derivan del índice, porque un motor solo puede citar lo que su sistema de recuperación puede alcanzar.
Una salvedad por adelantado. No todos los backends son públicos. Algunas empresas documentan su pipeline de recuperación en detalle, otras documentan solo sus rastreadores. Donde algo no está documentado, esta página lo dice exactamente así. La mecánica compartida de la generación aumentada por recuperación se cubre en cómo los motores de respuestas eligen sus fuentes; esta página es la referencia por motor.
ChatGPT
OpenAI documenta tres agentes: GPTBot recopila contenido para entrenar modelos fundacionales, OAI-SearchBot muestra sitios web en las funciones de búsqueda de ChatGPT, y ChatGPT-User accede a una página cuando la acción de un usuario lo requiere. La palanca documentada es OAI-SearchBot: OpenAI afirma que los sitios excluidos de él no se mostrarán en las respuestas de búsqueda de ChatGPT. Los detalles de los tokens y las contrapartidas de bloquearlos se cubren en rastreadores de IA.
Lo que OpenAI no documenta es la composición del índice detrás de la búsqueda de ChatGPT ni cómo se clasifican las fuentes dentro de él. Las afirmaciones de que funciona sobre algún índice de terceros en particular no están confirmadas por OpenAI y deben tratarse como no verificadas. OpenAI tampoco documenta ningún informe de citas orientado a editores.
Perplexity
Perplexity documenta dos agentes. PerplexityBot muestra y enlaza sitios web en los resultados de búsqueda de Perplexity y, según la documentación, no se usa para rastrear contenido para modelos fundacionales de IA. Perplexity-User accede a páginas para las preguntas de los usuarios y generalmente ignora robots.txt porque una persona solicitó el acceso. Bloquear PerplexityBot, por tanto, no protege nada en el lado del entrenamiento; solo te elimina de los resultados de Perplexity.
Más allá de esas descripciones de rastreadores, Perplexity no documenta públicamente cómo se ensambla su índice de recuperación ni cómo se clasifican las fuentes, y no documenta ningún informe de citas orientado a editores.
Gemini y las funciones de IA de Google
Google es el motor más completamente documentado. Su guía de funciones de IA afirma que AI Overviews y AI Mode usan generación aumentada por recuperación fundamentada en los sistemas centrales de clasificación de la Búsqueda, recuperando páginas del índice de la Búsqueda. El requisito de entrada es clásico: rastreable, indexada, elegible para fragmentos. Las respuestas muestran enlaces prominentes y clicables a las páginas de apoyo, y Search Console incluye un informe de rendimiento de IA generativa, la vía de primera mano para ver este tráfico.
En el lado de los rastreadores, Googlebot alimenta la Búsqueda y todo lo construido sobre ella, mientras que Google-Extended es un token de control de robots.txt que gobierna el entrenamiento de modelos Gemini y usos específicos de grounding, no la inclusión en la Búsqueda. La distinción se malinterpreta con frecuencia.
Claude
Anthropic documenta tres agentes: ClaudeBot recopila contenido web que podría contribuir al entrenamiento de modelos, Claude-SearchBot analiza contenido para mejorar la relevancia y la exactitud de las respuestas de búsqueda, y Claude-User accede a páginas cuando las personas hacen preguntas a Claude. La documentación para desarrolladores de Anthropic afirma que las respuestas producidas con búsqueda web incluyen citas de las fuentes extraídas de los resultados.
El índice detrás de esa búsqueda no está documentado públicamente. El artículo sobre rastreadores describe qué hace cada agente, no de dónde vienen los resultados de búsqueda, y la documentación para desarrolladores no nombra ningún proveedor de búsqueda ni índice. Cualquier afirmación sobre qué índice respalda la búsqueda web de Claude no está verificada. Anthropic no documenta ningún informe de citas orientado a editores.
Microsoft Copilot
Copilot es el caso más claro de un motor construido sobre un índice de búsqueda existente. Microsoft documenta la ruta de recuperación para Microsoft 365 Copilot y Copilot Chat: cuando la búsqueda web está habilitada, Copilot genera una consulta de búsqueda a partir del prompt del usuario, la envía al servicio de búsqueda de Bing y usa los resultados para fundamentar la respuesta en datos web. La visibilidad en esas respuestas pasa, por tanto, por el índice de Bing y su rastreador, Bingbot. Cómo pondera o selecciona Copilot entre los resultados de Bing que recibe no está documentado.
En febrero de 2026, Bing Webmaster Tools añadió un informe de AI Performance en vista previa pública, que cubre citas en Microsoft Copilot, resúmenes generados por IA en Bing e integraciones seleccionadas de socios. Muestra qué URLs se citan, las consultas de grounding que las recuperaron y cómo cambia la actividad de citas a lo largo del tiempo. Eso convierte a Google y Microsoft en las únicas dos empresas con un informe de citas de primera mano; OpenAI, Anthropic y Perplexity no documentan ningún equivalente.
Qué significa esto para tu robots.txt
Los tokens anteriores se dividen en rastreadores de entrenamiento, rastreadores de búsqueda y agentes activados por usuarios, y bloquearlos tiene consecuencias distintas. Bloquear un bot de entrenamiento como GPTBot o ClaudeBot es una decisión de política sin coste documentado en las respuestas de ningún motor. Bloquear un bot de búsqueda como OAI-SearchBot o PerplexityBot te elimina de la superficie de citas de ese motor. Las contrapartidas, token por token, viven en rastreadores de IA.
El trabajo es compartido, las superficies difieren
Nada de lo anterior suma cinco disciplinas separadas. Todos los motores necesitan los mismos insumos: páginas que su rastreador pueda alcanzar, pasajes que enuncien una respuesta con la claridad suficiente para citarla y contenido que se mantenga actualizado. Los motores difieren en cuánto se apoyan en la frescura: en un estudio de 7,683 páginas y 47,097 citas, Gemini citó contenido actualizado en el último año el 78 por ciento de las veces, ChatGPT el 73 por ciento y Perplexity el 65 por ciento. Qué actualizar, y con qué frecuencia, se cubre en frescura.
Lo que sí difiere es tu posición por motor, porque los índices difieren. La única forma de saber dónde estás es medir por motor, con muestreo repetido en lugar de comprobaciones puntuales. Muestrea también entre idiomas: en mediciones de respuestas de LLM sobre marcas, el idioma de la consulta explica entre el 26.5 y el 32.0 por ciento de la varianza de las respuestas, mientras que la identidad de marca explica el 1.5 por ciento. Qué significa eso para los mercados se cubre en GEO multilingüe.
| Motor | Rastreadores documentados | Backend de recuperación documentado | Informe de citas de primera mano |
|---|---|---|---|
| ChatGPT | GPTBot, OAI-SearchBot, ChatGPT-User | Un rastreador de búsqueda alimenta la búsqueda de ChatGPT; la composición del índice no está documentada | Ninguno documentado |
| Perplexity | PerplexityBot, Perplexity-User | Un rastreador de búsqueda dedicado; los detalles del índice no están documentados | Ninguno documentado |
| Gemini y las funciones de IA de Google | Googlebot, con Google-Extended como token de control | Sistemas centrales de clasificación de la Búsqueda y el índice de la Búsqueda | Informe de rendimiento de IA generativa en Search Console |
| Claude | ClaudeBot, Claude-SearchBot, Claude-User | No documentado | Ninguno documentado |
| Copilot | Bingbot, vía el índice de Bing | Consultas generadas enviadas al servicio de búsqueda de Bing | Informe de AI Performance en Bing Webmaster Tools (vista previa) |