改版或迁移时,robots相关的核对目标不是“文件还在不在”,而是确认新站是否允许搜索引擎抓取应当公开的页面,同时没有把旧站的限制规则原样带到新结构上。交付验收应同时看三件事:robots.txt的抓取规则是否符合新目录结构、被限制的路径是否确实不该被抓、以及抓取限制与索引移除是否被混为一谈。
robots.txt是抓取层面的约定,用来告诉爬虫哪些路径不希望被抓取。它不等于可靠的索引移除手段:页面即使被禁止抓取,仍可能因外部链接等原因出现在搜索结果中。反过来,站点地图提交也不保证收录,HTTPS也不保证安全无漏洞或排名提升。因此迁移验收不能只看robots文件是否返回正常,还要分别核查抓取、收录与展示三个环节。
要让robots核对可验收,先准备以下输入,否则无法判断规则对错:
迁移时常见两种做法,选择取决于页面是否还需要被搜索用户找到。
如果只是想让某页面从搜索结果消失,应优先使用页面级noindex并允许抓取,而不是用robots.txt禁止抓取——被禁止抓取的页面,爬虫可能看不到noindex指令。
按下面顺序检查,每步记录实际结果而非预期:
curl或浏览器直接访问新站/robots.txt,确认返回200且内容为纯文本,不是HTML错误页。Disallow: /一类全局限制遗留在正式环境。以下现象有多种解释,不要直接断定为某一原因:页面未收录,可能是被抓取限制、可能是规范标签指向他页、也可能是尚未被抓取;排名下降,可能来自内容与结构变化,也可能来自重定向链路或抓取预算变化。核对时应先确认“已经定位的原因”,再处理“可能原因”。若robots文件本身无法访问或返回错误状态,爬虫通常按可抓取处理,这会让本应屏蔽的路径暴露,属于需要优先修复的项。
下一步:把新旧URL对照表与旧robots.txt并排打开,逐条标注“保留、改写、删除”,再将改写后的规则放到测试环境验证命中结果,确认无误后再上线。