Skip to main content

Last updated

技术 SEO:一切所立的地基

技术 SEO 就是确保搜索引擎能够抵达、获取、渲染并存储你页面的那份工作。它做好了没人鼓掌,但它不成,其他一切都不成。互联网上最好的文章,如果爬虫过不去,就哪儿也排不上;而在 2026 年,同一道闸门也适用于 AI 答案:Google 的 AI 功能指引要求内容必须已编入索引、可抓取并具备 snippet 资格,才可能出现在任何地方。本页按爬虫遇到它们的顺序,逐层讲解。

抓取访问:robots.txt 与状态码

爬虫检查的第一个文件是 robots.txt,它告诉爬虫可以获取哪些路径。有两种失败模式反复出现:屏蔽了包含你希望被找到内容的目录,以及屏蔽了页面渲染所需的 CSS 或 JavaScript 文件。每当站点结构变化时都要复查这个文件,而不是上线时看一次就完事。

状态码是第二道闸门。你希望被编入索引的页面应当返回 200。已迁移的内容应当返回 301 指向新地址,而不是一连串跳转。已移除的内容应当返回 404 或 410,而不是一个返回 200 却带着错误信息的软页面,因为软错误会浪费抓取注意力并干扰去重。反复出现的 5xx 响应告诉 Google 服务器吃力,抓取随之放缓。

XML 站点地图

站点地图是一份机器可读的网址清单,列出你认为规范的网址,可选地附上最后修改日期。它不能强制索引,也不能推翻质量判断;它让发现变得可靠,这在大型站点、外链稀少的新站点,以及页面频繁变动的站点上最为重要。要自动保持它的时效。一份塞满死链或跳转网址的站点地图,会训练爬虫少信任它。

准确地说说 IndexNow

IndexNow 是一种协议,用于在网址被新增、更新或删除的那一刻 ping 参与的搜索引擎,而不必等待重新抓取。Bing 和 Yandex 参与其中。Google 不使用 IndexNow,所以一次 ping 对 Google 搜索毫无作用;对 Google 来说,站点地图和内部链接仍是发现机制。IndexNow 实现成本很低,为那些会听的引擎值得配上,只要你对哪些引擎会听这件事对自己诚实。

渲染与 JavaScript

Google 能够执行 JavaScript,但渲染是抓取之后一个独立、延后的步骤。只有在客户端脚本运行后才存在的内容,比初始 HTML 中就有的内容被索引得更晚也更脆弱,而且一旦所需脚本被屏蔽或出错,它就彻底失效。安全的做法很简单:把必须参与排名的内容放进服务端渲染的 HTML,让 JavaScript 去增强页面而不是构建页面。

速度与 Core Web Vitals

Core Web Vitals 衡量用户所体验到的加载、交互和视觉稳定性。Google 的页面体验文档说这些信号被其排名系统使用,同时明确相关性优先:一个有着最佳答案的慢页面,仍然可以排在一个答案更差的快页面之前。把速度当成打破平局并保护转化的体验信号,而不是实质内容的替代品。

Canonical 与重复内容处理

大多数站点会在多个地址上提供相同内容:带斜杠和不带斜杠、带网址参数、还有各种测试环境副本。Google 会选出一个规范版本并把信号合并到它身上。你的任务是让这个选择变容易:统一的内部链接约定、指向你所期望位置的 rel canonical 标签、与 canonical 一致的重定向,以及一份只列出规范网址的站点地图。当这些互相矛盾时,Google 会替你决定,而且未必按你想要的方式。

哪些问题同样会毁掉 AI 可见度

上面每一种失败也都会把你从 AI 答案里剔除。因为 Google 通过与经典搜索相同的索引和排名系统来支撑其 AI 功能,一个被屏蔽、被 noindex、无法渲染或被 canonical 指走的页面无法被检索,而无法被检索的页面无法被引用。不可抓取就等于不可引用。AI 没有独立的技术通道:Google 搜索会忽略 llms.txt,也没有哪个特殊文件能替代一个可获取的页面。先把管道理顺,然后把精力放到页面内结构赢得引用的实质内容上。

交给自动运行

Vupie 会落实本指南中的一切,每月八篇高质量文章。

加入内测