Skip to main content

Last updated

答案引擎如何挑选来源

当 ChatGPT、Perplexity、Gemini 或 Google 的 AI Overviews 回答一个问题时,它们会引用少数几个网页。这些引用不是装饰。它们是一个筛选过程的产物,而这个过程的文档程度足以把它讲清楚。本页讲解其中的机制:内容如何被检索,来源如何被挑选,一个页面要具备什么条件才可能进入考量,以及为什么衡量自己的被引用情况比看上去难得多。

检索增强生成

答案引擎并不只凭模型记忆作答。它们使用检索增强生成(RAG):在提问时,系统先从索引中检索相关文档,然后生成一条以检索结果为依据的回答。被它取用的页面就成了引用。这正是 AEO 之所以可能的原因。模型的训练数据是固定的,但检索这一步跑在一个活的索引上,而你的内容可以进入这个索引,并改善自己在其中的位置。

以排名系统为依据

具体到 Google,Google 的 AI 功能指南说明,AI Overviews 和 AI Mode 使用以核心搜索排名系统为依据的检索增强生成来挑选内容。检索这一步并不是另一套独立、神秘的算法。决定自然排名的那套系统,同时决定了生成层能读到什么。有排名的内容,才是可以被引用的内容。

Query fan-out

Google 描述过一种叫 query fan-out(查询扇出)的技术:系统同时发出多个相关查询,为单个问题收集语境。实际后果是,你的页面可能因为一个用户从未输入过的查询而被检索到。一个关于价格的问题,可能扇出成关于功能、替代方案和上手设置的查询。覆盖了一个主题邻近子问题的页面,就有更多可以被检索找到的接触面。

引用如何呈现

Google 的指南指出,AI 回答会展示指向支撑页面的醒目可点击链接。因此,被选为来源就是在答案给出的那一刻发生的可见品牌曝光,也是读者想要核实或深入了解时会走的路径。Google 的 Search Console 包含一份生成式 AI 效果报告,这是查看这类流量的第一方方式。

入场券:已编入索引且具备 snippet 资格

要成为候选,页面必须可抓取、已编入索引,并有资格作为 snippet 展示。入场要求就这么多。按照 Google 的指南,不需要任何特殊标记或 AI 专用文件,Google 搜索会忽略 llms.txt,生成式 AI 功能也不要求结构化数据。Google 明确建议不要为 AI 把内容切块或采用特殊格式书写。如果一个页面无法作为普通 snippet 出现,它就无法出现在 AI 答案里;如果它可以,那么技术层面就不再需要别的什么了。

非 Google 引擎有何不同

ChatGPT、Perplexity 和 Claude 并不依托 Google 的索引。它们运行自己的爬虫和检索系统,因此同一个页面在不同引擎中的地位可能不同,而它们对新鲜内容的胃口也存在可测量的差异。一项针对 7,683 个页面和 47,097 条引用的研究发现,Gemini 有 78% 的时候引用了过去一年内更新过的内容,ChatGPT 为 73%,Perplexity 为 65%。被引用的内容里只有 42% 是近期才发布的,这意味着引擎所奖励的新鲜度,主要来自对已有页面的更新,而不是来自新页面。如果 Perplexity 对你重要,一个陈旧但持续维护的页面仍有竞争力;而在 Gemini 上,一个停滞的页面希望渺茫。

为什么引用测量噪声很大

检查一个引擎是否引用了你,听起来很简单:问它,然后看结果。实际上输出并不稳定。在三次完全相同的 ChatGPT 运行中,大约只有 2.2% 的被引用来源保持稳定。在对大语言模型品牌回答的测量中,查询所用的语言解释了 26.5% 到 32.0% 的测量方差,而品牌身份只解释 1.5%。你怎么问,对结果的影响远大于你是谁。

由此得出两个结论。第一,单次查询检查提供不了可靠信号;只有跨措辞、跨时间的重复取样才能显示趋势。第二,对待供应商的仪表盘要谨慎:没有任何第三方工具能接触到 Google 的内部系统,所以任何外部的引用数字都是一次取样,而不是一本账。想知道这对你的内容策略意味着什么,请看什么是 AEO

交给自动运行

Vupie 会落实本指南中的一切,每月八篇高质量文章。

加入内测