上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到该抓的页面、抓不到不该抓的页面、抓到的页面能进入索引并返回正确的规范地址。做法不是逐个点开页面看,而是从交付结果倒推一份可验收的清单:robots.txt、sitemap、canonical、meta robots、状态码、内链入口,逐项对照预期结果签字确认。
抓取与索引配置的验收结果可以写成一句话:目标页面全部可抓、可索引,且规范地址唯一;非目标页面明确拒绝抓取或拒绝索引。围绕这句话拆任务:
责任到项,验收才有依据。任何一项没有明确负责人,上线后都容易变成“以为别人检查过了”。
下面每一项都给出检查动作和判断结果,可直接作为上线前的验收表。
Disallow: /这类全站禁止规则。判断结果:目标页面路径不在禁止列表内,测试环境域名不被放行到线上索引。noindex或nofollow。判断结果:需要收录的页面没有noindex,不需要收录的页面(如后台、搜索结果页)明确加上。逐页目测既慢又容易漏。更可靠的做法是模拟爬虫抓取一遍,把结果导出成表格比对。例如用命令行请求首页并查看响应头:
curl -I -A "Mozilla/5.0 (compatible; Googlebot/2.1)" https://example.com/
把返回的状态码、是否重定向、响应时间记录下来。适用条件:服务器未对爬虫做特殊限制时,这个结果能反映爬虫看到的内容。如果站点使用CDN或WAF,需确认其规则没有把爬虫UA拦截成403或验证页,这类拦截在浏览器里看不出来,只有模拟请求才会暴露。
抓取工具跑完后,重点看三类异常:返回非200的URL、canonical指向与自身不一致的URL、被robots.txt阻止但又在sitemap里的URL。前两类影响索引,第三类属于配置自相矛盾,必须在上线前解决。
有几种情况容易被当成故障,实际属于正常或需要区分对待:
这些判断的共同前提是:先看实际返回的标签和状态码,再解释现象,不凭经验直接断定原因。
配置核对通过后,把sitemap地址提交到对应的搜索资源平台,并在上线后一周内复查抓取状态和索引覆盖情况。发现异常时,回到本文清单定位是抓取层还是索引层的问题,再决定改robots、改标签还是改内链,避免同时改动多项导致无法判断哪一步生效。