Skip to main content

Last updated

诚实地衡量 AI 搜索可见度

越来越多的工具承诺追踪你的品牌在 AI 答案中的位置,常常是用单条提示词跑出一个每日分数。方差数据说明,那个数字是噪声。本页讲清楚方差实际有多大,站得住脚的测量需要什么,以及没有哪个工具能正当地宣称什么。

为什么单次检查是噪声

生成式引擎是取样系统:同一个问题不会两次返回同一个答案。在测试中,三次完全相同的 ChatGPT 运行只让大约 2.2% 的被引用来源在三次中都保持稳定。同一个问题问三遍,几乎整份引用清单都会变。建立在一条提示词之上的每日检查,衡量的不是你的可见度,而是骰子。

对大语言模型品牌回答的方差分析显示了波动究竟从何而来:

因素在回答方差中的占比
重复同一措辞34.8%
查询所用的语言26.5% 到 32.0%
品牌身份1.5%

请仔细读这张表。问题怎么问、用什么语言问,主导了结果。被问到的是哪个品牌只占 1.5%。一个每天用一种措辞、一种语言、在一个模型上检查一次的工具,几乎在取样你关心的东西以外的一切。当昨天的分数和今天不一样时,那是取样系统的预期行为,而不是你的内容发生了什么变化的信号。

站得住脚的测量是什么样子

这一切并不意味着 AI 可见度无法测量。它意味着这是一个统计学问题,而要求是那些普通的要求:

  • 一套固定的提示词集合,跨多种措辞运行。每个问题都有多种措辞,并在各轮测量之间保持不变,这样措辞方差会被平均掉,而不会被误当成变化。
  • 多种语言。查询语言占 26.5% 到 32.0% 的方差。如果你的客户用不止一种语言提问,只用一种语言测量会漏掉大部分图景。
  • 多个模型。各引擎的引用方式不同,某一个引擎上的变动说明不了其他引擎的情况。
  • 重复运行并给出置信区间。报告一个区间,而不是一个点。没有区间的可见度数字,是被当成事实呈现的一次随机抽取。
  • 按月的节奏。日与日之间的波动被取样噪声主导。把一个月的运行汇总起来做逐月对比,是真实变化能与噪声分开的最短窗口。

有第一方报告的地方就用 Google 自己的报告

具体到 Google 的 AI 功能,Search Console 包含一份生成式 AI 效果报告。这些数据来自 Google 自己的系统,而不是取样提示词,这让它成为唯一一个可以照单全收的 AI 可见度数字。对于不提供第一方报告的引擎,带置信区间的取样测量就是诚实的上限,而且应当标明它是估算。

没有哪个工具能宣称什么

Google 表示,没有任何第三方工具能进入其系统内部。每一个外部工具,无论其仪表盘暗示了什么,都是在外面跑提示词并对结果取样,跟你自己能做的完全一样。当这种做法被呈现为带误差棒的取样时,它是正当的。当它被呈现为对内部状态的读数时,就不正当了。把这些当作危险信号:

  • 由单次提示词运行拼出来的每日趋势线。
  • 一个精确却不附带置信区间的分数。
  • 在多语言市场里只用一种语言测出的排名。
  • 任何声称对某个引擎内部数据拥有特殊访问权限的说法。

诚实的测量比每日分数更慢、更不戏剧化,而它是唯一一种支撑得起决策的测量。至于 Google 自己建议优化什么,见 Google 到底怎么说 AI 搜索优化

交给自动运行

Vupie 会落实本指南中的一切,每月八篇高质量文章。

加入内测