上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终展示的地址是唯一且正确的。下面是一份可直接执行的清单,每项都说明查什么、怎么查、结果意味着什么。
在浏览器打开 你的域名/robots.txt,逐条看 Disallow 规则。
Disallow: / 挡住,说明所有页面都抓不到,必须删除或改成只屏蔽后台、测试目录。/css/、/js/ 这类静态资源目录,搜索引擎仍能抓页面,但可能无法正确渲染,移动端体验判断会受影响,建议放开。Allow 与 Disallow 冲突时,按最长匹配优先,短规则不一定生效,要按实际路径核对。适用条件:这是上线前必查项,任何类型的站点都适用。判断结果:只要目标页面路径被 Disallow 覆盖,就不能指望它出现在搜索结果里。
查看页面源码中的 <meta name="robots"> 标签。
noindex:该页面即使被抓取也不会进入索引,适合后台、搜索结果页、重复内容页,但不该出现在首页和栏目页上。nofollow:链接权重传递被限制,如果全站误加,内页发现速度可能变慢。检查方法:用浏览器开发者工具搜索 robots,或批量抓取页面源码比对。模板生成的页面最容易出现“测试时加了 noindex,上线忘了删”的情况。
同一内容存在多个可访问地址时,需要指定一个规范版本,否则索引会分散。
http 是否 301 跳转到 https,以及带 www 与不带 www 是否只保留一个版本。<link rel="canonical"> 指向的地址,是否与当前页面实际地址一致。判断结果:如果 canonical 指向的地址本身返回 404 或跳转到别的页面,规范信号会失效,需要改成可正常访问的最终地址。
站点地图不是收录保证,但能帮助发现页面。核对以下几点:
你的域名/sitemap.xml,确认返回的是 XML 而不是 404 或 HTML 错误页。适用条件:页面数量多、层级深的站点尤其要查。判断结果:如果某页面只存在于站点地图、站内没有任何入口链接,被抓取的概率会明显降低。
用搜索引擎官方的抓取测试工具或日志检查,确认抓取状态码。
如果页面正文由 JavaScript 渲染,要对比源码中是否有内容。源码为空、渲染后才有内容时,抓取和索引效果取决于搜索引擎的渲染能力,不能默认等同于普通 HTML 页面。
完成以上检查后,下一步是保持监控:在搜索引擎站长平台提交站点地图,并定期查看抓取统计与索引覆盖报告,发现异常页面及时回到对应清单项排查。