robots改版或迁移时应核对什么:先定抓取边界再验索引结果

📍 WDQWDWQD987AAAAA:216.73.217.111
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /22af8a56012d.html
📄

robots改版或迁移时应核对什么:先定抓取边界再验索引结果

改版或迁移时,robots相关的核对目标不是“文件还在不在”,而是确认新站是否允许搜索引擎抓取应当公开的页面,同时没有把旧站的限制规则原样带到新结构上。交付验收应同时看三件事:robots.txt的抓取规则是否符合新目录结构、被限制的路径是否确实不该被抓、以及抓取限制与索引移除是否被混为一谈。

先明确robots.txt能做什么、不能做什么

robots.txt是抓取层面的约定,用来告诉爬虫哪些路径不希望被抓取。它不等于可靠的索引移除手段:页面即使被禁止抓取,仍可能因外部链接等原因出现在搜索结果中。反过来,站点地图提交也不保证收录,HTTPS也不保证安全无漏洞或排名提升。因此迁移验收不能只看robots文件是否返回正常,还要分别核查抓取、收录与展示三个环节。

从交付结果倒推:迁移时必须准备的资料

要让robots核对可验收,先准备以下输入,否则无法判断规则对错:

两种处理方案的比较与适用条件

迁移时常见两种做法,选择取决于页面是否还需要被搜索用户找到。

  1. 保留并改写robots规则:适用于新站仍有大量不应被抓取的目录,且这些目录路径与旧站不同。做法是把旧规则映射到新路径,逐条确认通配符和目录层级没有误伤公开页面。判断结果是:公开页面可被抓取,敏感目录被限制。
  2. 暂时放开抓取、仅靠重定向与规范标签处理:适用于旧页面已全部重定向到新页面,且没有必须屏蔽的目录。此时robots不应继续禁止旧路径,否则爬虫无法读到重定向。判断结果是:重定向可被跟随,新页面可被抓取。

如果只是想让某页面从搜索结果消失,应优先使用页面级noindex并允许抓取,而不是用robots.txt禁止抓取——被禁止抓取的页面,爬虫可能看不到noindex指令。

可执行的核对步骤

按下面顺序检查,每步记录实际结果而非预期:

验收时容易误判的检查项

以下现象有多种解释,不要直接断定为某一原因:页面未收录,可能是被抓取限制、可能是规范标签指向他页、也可能是尚未被抓取;排名下降,可能来自内容与结构变化,也可能来自重定向链路或抓取预算变化。核对时应先确认“已经定位的原因”,再处理“可能原因”。若robots文件本身无法访问或返回错误状态,爬虫通常按可抓取处理,这会让本应屏蔽的路径暴露,属于需要优先修复的项。

下一步:把新旧URL对照表与旧robots.txt并排打开,逐条标注“保留、改写、删除”,再将改写后的规则放到测试环境验证命中结果,确认无误后再上线。

图1 图2

nginx