AI 抓取工具:谁在抓取你的网站,每个令牌又控制什么
每一个回答你所在市场问题的 AI 引擎都会抓取网页内容,每家厂商也都会公布可以在 robots.txt 中允许或屏蔽的用户代理令牌。这些令牌并不能互相替代。有的用于喂养模型训练,有的用于构建引擎引用来源的搜索索引,还有的是因为用户刚刚提问而实时抓取某个页面。屏蔽错了,你会白白放弃可见性,却什么也没保护到。
三类抓取程序
厂商文档把它们清晰地分成三种角色。训练抓取工具收集可能被用于训练未来基础模型的内容。搜索抓取工具构建引擎用来为答案接地并给出引用的检索索引。用户触发的抓取程序在用户的问题需要时即时访问页面。只有第一种角色涉及训练。只有另外两种决定你能否出现在回答中。
OpenAI:GPTBot、OAI-SearchBot 和 ChatGPT-User
OpenAI 对自己的机器人做了文档说明,划分正是沿着这条线。GPTBot 抓取内容用于训练生成式 AI 基础模型,禁止它就表示你的内容不应被用于该训练。OAI-SearchBot 用于在 ChatGPT 的搜索功能中呈现网站,OpenAI 明确表示,退出该机器人的网站不会出现在 ChatGPT 的搜索回答中。ChatGPT-User 为 ChatGPT 和 Custom GPTs 中的用户操作执行抓取;由于这些操作由用户发起,OpenAI 指出 robots.txt 规则可能并不适用,而且这个代理不决定是否被收录进搜索。实际要点是:屏蔽 GPTBot 不会把你从 ChatGPT 搜索中移除。屏蔽 OAI-SearchBot 才会。
Anthropic:ClaudeBot、Claude-SearchBot 和 Claude-User
Anthropic 对三个代理做了文档说明,分工完全相同。ClaudeBot 收集可能有助于模型训练的网页内容,禁止它就表示你未来的材料应被排除在训练数据集之外。Claude-SearchBot 分析内容,以提升搜索回答的相关性和准确性;屏蔽它可能会降低你在那些结果中的可见性。Claude-User 在有人向 Claude 提问时抓取页面,屏蔽它会让你的内容无法为用户的查询被检索到。
Perplexity:PerplexityBot 和 Perplexity-User
Perplexity 的抓取工具文档写明,PerplexityBot 的存在是为了在 Perplexity 的搜索结果中呈现并链接网站,而不用于为 AI 基础模型抓取内容。因此屏蔽它在训练那一侧什么也保护不了;它只会让你失去在 Perplexity 结果中的存在。Perplexity-User 支持用户操作,并且通常忽略 robots.txt 规则,因为抓取是用户请求的。它同样不用于训练。
Google:Googlebot 和 Google-Extended
Google-Extended 是这份清单上最常被误读的令牌。按照 Google 的抓取工具文档,它根本不是一个独立的抓取工具:抓取由现有的 Google 用户代理完成,而 Google-Extended 是一个起控制作用的 robots.txt 令牌。它控制被抓取的内容是否可以用于训练未来的 Gemini 模型,以及用于 Gemini Apps 和 Vertex AI 上的 Grounding with Google Search 中的接地。Google 明确说明,它不影响网站在 Google Search 中的收录,也不是排名信号。Search 内部的 AI 功能由适用于 Googlebot 的常规 Search 控制项管辖,而不是由 Google-Extended 管辖。屏蔽 Google-Extended 会让你的内容不进入 Gemini 训练。屏蔽 Googlebot 会让你从 Search 以及在它之上构建的一切中消失。
逐个令牌看取舍
| 令牌 | 屏蔽它能阻止 | 屏蔽它的代价 |
|---|---|---|
| GPTBot | 你的内容被用于 OpenAI 的模型训练 | 对 ChatGPT 搜索没有已记录的影响 |
| OAI-SearchBot | 被收录进 ChatGPT 搜索 | 出现在 ChatGPT 的搜索回答中 |
| ChatGPT-User | 几乎没有;robots.txt 可能不适用于用户操作 | 由用户发起的对你页面的抓取 |
| ClaudeBot | 你的内容被用于 Anthropic 的模型训练 | 搜索那一侧没有任何已记录的损失 |
| Claude-SearchBot | 为 Claude 的搜索回答建立索引 | 在那些回答中的可见性 |
| Claude-User | 为单个用户查询进行的检索 | 在用户发起的网页搜索中的可见性 |
| PerplexityBot | 训练方面什么也阻止不了;它是搜索机器人 | 出现在 Perplexity 的结果中 |
| Google-Extended | Gemini 训练以及文档列出的那些接地用途 | 按 Google 的说法,在 Google Search 中没有任何代价 |
| Googlebot | Google Search 本身 | 搜索可见性,以及在它之上构建的 AI 功能 |
干净的判断方式是:训练令牌是一个你可以两边选的政策决定,而搜索令牌和用户令牌是一个收入决定,因为检索不到你的引擎也引用不了你。验证检索类抓取工具是否真的能访问到你的页面,属于技术 SEO的范畴;而它们拿到你的内容之后会做什么,在什么是 GEO中讲到。