llms.txt:提案、承诺与实测的现实
llms.txt 是一个被提出的约定:在 /llms.txt 提供一个 markdown 文件,给语言模型一份经过挑选的网站精华内容地图。它不是标准,也没有任何主流引擎采纳它。这并没有阻止一个小行业把生成 llms.txt 当作 AI 可见性的杠杆来卖,所以本页把这个说法拿去对照提案本身、厂商文档和服务器日志检验一遍。
这个提案从哪里来
该提案由 Jeremy Howard 于 2024 年 9 月发表在 llmstxt.org 上。它的理由很实际。相对于整个网站,语言模型的上下文窗口很小,而 HTML 页面里带着导航、脚本和标记,会浪费这些空间。一份经过挑选的 markdown 索引,能让模型或智能体直接找到实质材料。
规范很短。它要求在根路径提供一个 markdown 文件,其中有一个写明站点名称的 H1,这是唯一的必需元素,随后是一段引用块摘要、可选的散文小节,以及用 H2 分隔的链接列表并配上简短说明。一个标题为"Optional"的小节标出在上下文紧张时可以跳过的链接。该提案还建议在同一 URL 后加上 .md,提供重要页面的干净 markdown 副本。这些都不难做,问题也不在这里。问题在消费的那一端。
谁说自己在用它
没有任何主流引擎记录说自己会为检索而遵循 llms.txt。Google 在它的 AI 功能指引中直接表示,llms.txt 会被 Google Search 忽略;这份文档的其余部分在 Google 到底怎么说 AI 搜索优化中走了一遍。
OpenAI、Anthropic 和 Perplexity 都为自己的抓取工具发布了详细文档,逐个令牌的说明在 AI 抓取工具与每个令牌控制什么中。那些文档里没有一处提到 llms.txt。这些厂商中没有任何一家发表过声明,承诺让生产环境的回答系统去读这个文件。支持的情况不是参差不齐,也不是正在浮现。截至撰写本文时,它是缺席的。
日志显示了什么
文档可能落后于实践,所以更有力的证据是服务器日志。如果引擎在用这个文件,它们就会去抓取它。两项测量说明它们没有。
一项为期 90 天的抓取日志实验记录了 62,100 次 AI 机器人请求。其中有 84 次抓取了 llms.txt 文件,约占 0.1%。
一项针对 137,000 个网站的研究测量了一个月的窗口期,发现 28% 的域名发布了有效的 llms.txt 文件,而其中 97% 的文件从未被任何东西抓取过,无论是 AI 抓取工具还是别的什么。同一批数据也显示了硬币的另一面:在没有该文件的域名上,AI 机器人对它的请求数为零。它们并不会去找。
一个不会被抓取的文件,无法影响引擎在谈论你时会说什么。无论 llms.txt 将来会变成什么,说它今天能改善 AI 可见性,没有任何测量支持。
llms.txt 不是 robots.txt
这两个文件常被放进同一条建议里,但它们做的是不同的事。robots.txt 是一种访问控制约定:各家 AI 厂商为它记录了自己的用户代理令牌,例行请求它,并说明每个令牌管辖什么。llms.txt 是一个内容发现提案,而这些同样的厂商并没有采纳它。写在 llms.txt 文件里的任何内容,都不会授予、限制或表明任何关于访问的东西。关于哪些 AI 系统可以抓取你的站点的决定,是在 robots.txt 里逐个令牌做出的,如 AI 抓取工具中所讲。把这两个文件混为一谈,会在两个方向上都做出错误的决定。
一个合理的立场
发布一个 llms.txt 文件只花几分钟,之后就没有成本了。Google 说这个文件既没有帮助也没有害处。如果采纳有一天真的到来,一个已经发布的文件就已经就位,而你自己的服务器日志会显示抓取率变化的那一天。基于这一点,有一个是无害的对冲。
为它付钱则是另一回事。引擎不会读的文件不可能是一种优化,而花在生成、审计或监控 llms.txt 上的钱,就是没有花在那些有文档证明确实重要的、不起眼的工作上:可被编入索引的页面、可回答的内容、可核实的论断。Vupie 为自己的站点和客户站点生成 llms.txt,并且不为它宣称任何效果,这正是证据所支持的立场。