Skip to main content

Last updated

ChatGPT、Perplexity、Gemini、Claude 与 Copilot:每个引擎的答案从哪里来

答案引擎从外面看很像:一个问题进去,一条带引用的回答出来。底下它们有三处不同:每个引擎检索所用的索引、喂养这个索引的抓取工具,以及引用如何抵达读者。大部分实际差异都源自索引,因为一个引擎只能引用它的检索系统够得着的东西。

先说一句提醒。并不是每个后端都是公开的。有些公司详细记录了自己的检索流程,有些只记录了自己的抓取工具。凡是没有公开记录的地方,本页都会照实说明。检索增强生成的共同机制在答案引擎如何挑选来源中讲到;本页是逐引擎的参考。

ChatGPT

OpenAI 记录了三个抓取程序:GPTBot 收集内容用于训练基础模型,OAI-SearchBot 在 ChatGPT 的搜索功能中呈现网站,ChatGPT-User 在用户的操作需要时抓取页面。有文档支持的那个杠杆是 OAI-SearchBot:OpenAI 表示,退出该机器人的网站不会出现在 ChatGPT 的搜索回答中。令牌细节和屏蔽的取舍在 AI 抓取工具中讲到。

OpenAI 没有记录的,是 ChatGPT 搜索背后索引的构成,以及来源在其中如何排序。声称它运行在某个特定第三方索引之上的说法未经 OpenAI 确认,应当视为未经证实。OpenAI 也没有记录任何面向发布方的引用报告。

Perplexity

Perplexity 记录了两个代理。PerplexityBot 在 Perplexity 的搜索结果中呈现并链接网站,按照文档,它不用于为 AI 基础模型抓取内容。Perplexity-User 为用户的问题抓取页面,并且通常忽略 robots.txt,因为抓取是由人请求的。因此屏蔽 PerplexityBot 在训练那一侧什么也保护不了;它只会把你从 Perplexity 的结果中移除。

除了这些抓取工具的描述之外,Perplexity 没有公开记录它的检索索引是如何构建的,也没有记录来源如何排序,同样没有面向发布方的引用报告。

Gemini 与 Google 的 AI 功能

Google 是记录得最完整的引擎。它的 AI 功能指南说明,AI 概览和 AI 模式使用接地于核心 Search 排名系统的检索增强生成,从 Search 索引中检索页面。准入条件是传统的:可抓取、已编入索引、具备摘要资格。回答中会显示醒目、可点击的支撑页面链接,而 Search Console 提供生成式 AI 效果报告,这是查看这类流量的第一方途径。

在抓取工具这一侧,Googlebot 喂养 Search 以及在它之上构建的一切,而 Google-Extended 是一个 robots.txt 控制令牌,管辖 Gemini 模型训练和特定的接地用途,而不是在 Search 中的收录。这个区别常被读错。

Claude

Anthropic 记录了三个代理:ClaudeBot 收集可能有助于模型训练的网页内容,Claude-SearchBot 分析内容以提升搜索回答的相关性和准确性,Claude-User 在有人向 Claude 提问时抓取页面。Anthropic 的开发者文档说明,借助网页搜索生成的回答会为取自结果的来源附上引用。

那个搜索背后的索引没有公开记录。抓取工具那篇文章描述的是每个代理做什么,而不是搜索结果从哪里来,开发者文档也没有点名任何搜索提供方或索引。任何关于哪个索引支撑 Claude 网页搜索的说法都是未经证实的。Anthropic 没有记录面向发布方的引用报告。

Microsoft Copilot

Copilot 是构建在既有搜索索引之上的引擎中最清楚的一例。Microsoft 记录了检索路径:对于 Microsoft 365 Copilot 和 Copilot Chat,当网页搜索启用时,Copilot 会从用户的提示词生成一个搜索查询,发送给 Bing 搜索服务,并用返回的结果把回答接地在网页数据上。因此在那些回答中的可见性要经过 Bing 的索引和它的抓取工具 Bingbot。Copilot 如何对收到的 Bing 结果赋权或从中挑选,没有公开记录。

2026 年 2 月,Bing Webmaster Tools 新增了 AI 效果报告并进入公开预览,覆盖 Microsoft Copilot、Bing 中的 AI 生成摘要以及部分合作伙伴集成中的引用。它显示哪些 URL 被引用、检索到它们的接地查询,以及引用活动随时间的变化。这使得 Google 和 Microsoft 成为仅有的两家提供第一方引用报告的公司;OpenAI、Anthropic 和 Perplexity 都没有记录同类报告。

这对你的 robots.txt 意味着什么

上面这些令牌分成训练抓取工具、搜索抓取工具和用户触发的抓取程序,屏蔽它们的后果各不相同。屏蔽 GPTBot 或 ClaudeBot 这类训练机器人是一个政策选择,在任何引擎的回答中都没有已记录的代价。屏蔽 OAI-SearchBot 或 PerplexityBot 这类搜索机器人,会把你从该引擎的引用界面上移除。逐个令牌的取舍在 AI 抓取工具中。

工作是共通的,界面各不相同

上面这些加起来并不构成五门独立的学科。每个引擎需要的输入都一样:抓取工具够得着的页面、把答案说得足够明白以便被引用的段落,以及保持最新的内容。各个引擎倚重时效性的程度确实不同:在一项覆盖 7,683 个页面和 47,097 次引用的研究中,Gemini 有 78% 的时候引用过去一年内更新过的内容,ChatGPT 是 73%,Perplexity 是 65%。该更新什么、多久更新一次,在时效性中讲到。

真正不同的是你在每个引擎中的处境,因为索引不同。要知道自己站在哪里,唯一的办法是按引擎衡量,用反复采样而不是抽查。也要跨语言采样:在对 LLM 品牌回答的测量中,查询语言解释了 26.5% 到 32.0% 的回答方差,而品牌身份只解释 1.5%。这对各个市场意味着什么,在多语言 GEO中讲到。

引擎已记录的抓取工具已记录的检索后端第一方引用报告
ChatGPTGPTBot、OAI-SearchBot、ChatGPT-User一个搜索抓取工具喂养 ChatGPT 搜索;索引构成未记录无记录
PerplexityPerplexityBot、Perplexity-User专门的搜索抓取工具;索引细节未记录无记录
Gemini 与 Google 的 AI 功能Googlebot,以及作为控制令牌的 Google-Extended核心 Search 排名系统与 Search 索引Search Console 中的生成式 AI 效果报告
ClaudeClaudeBot、Claude-SearchBot、Claude-User未记录无记录
CopilotBingbot,经由 Bing 的索引生成的查询发送给 Bing 搜索服务Bing Webmaster Tools 中的 AI 效果报告(预览)

交给自动运行

Vupie 会落实本指南中的一切,每月八篇高质量文章。

加入内测