robots txt文件改版或迁移时应核对什么-先查抓取规则再查旧路径

📍 WDQWDWQD987AAAAA:216.73.217.35
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /3911318e0938.html
📄

robots txt文件改版或迁移时应核对什么-先查抓取规则再查旧路径

改版或迁移时,robots txt文件最先要核对的是:新站是否仍允许抓取重要栏目,旧站的限制规则是否被原样带到了新环境,以及被屏蔽的路径是否已经不存在或不再需要屏蔽。时间和人手有限时,优先检查整站禁止抓取、旧目录屏蔽和规则指向的路径是否有效这三类问题,因为它们会直接影响搜索引擎能否发现新页面。

假设例子:迁移后流量下滑,先看哪一行

假设某站点从旧域名迁移到新域名,运维人员把旧站的robots txt文件直接复制到新站根目录。旧文件里有一条规则屏蔽了/old/目录,但新站把重要内容放在/old/之外的新路径下,同时新站又新增了一条Disallow: /用于测试,测试结束后忘记删除。此时搜索引擎抓取新站时可能无法进入任何页面。这个例子是假设,不是真实项目结果,但它对应了迁移中最常见的两类错误:把旧规则当成通用规则,以及临时规则没有清理。

核对步骤可以这样安排:

  1. 打开新站根目录下的robots txt文件,逐行确认是否存在Disallow: /。如果存在,判断它是否仍然符合当前需求;若只是测试残留,应删除或改成精确路径。
  2. 检查每一条Disallow后面的路径,在新站中是否真实存在。旧目录已经不存在时,对应规则可以删除;旧目录仍存在但需要保留访问时,则要重新评估。
  3. 检查Sitemap行指向的地址是否为新站可访问的站点地图。站点地图不保证收录,但地址写错会让发现入口失效。
  4. 用搜索引擎的抓取测试工具或直接请求该文件,确认返回状态正常、内容为纯文本,而不是被重定向到HTML页面。

核对清单:改版迁移时最容易漏掉的项

判断结果:什么情况算通过,什么情况要立即处理

如果新站robots txt文件允许抓取主要栏目,没有整站屏蔽,Sitemap地址可访问,且被屏蔽路径与当前业务需求一致,可以视为通过。若发现整站屏蔽、重要目录被误屏蔽、站点地图地址错误,应优先处理,因为它们会直接妨碍新页面被发现。若只是屏蔽了确实不需要抓取的旧目录或后台路径,可以按低优先级处理。不同搜索引擎对robots txt的支持细节可能存在差异,涉及具体搜索引擎时,应分别查看其官方文档中的抓取规则说明。

人手有限时的处理顺序

先处理会影响全站抓取的规则,再处理影响栏目级发现的规则,最后清理无效或过期的旧规则。改版或迁移完成后,不要只检查一次;在新站上线后的一段时间内,重新请求robots txt文件并确认内容没有被服务器配置、CDN或重定向改写。HTTPS不保证安全无漏洞或排名,它只是传输层配置,不能替代对robots txt文件本身的核对。

下一步可以直接打开新站根目录下的robots txt文件,按上面的清单逐行标记:保留、删除或修改。对拿不准的规则,先查该路径在新站中是否真实存在,再决定是否继续屏蔽。

图1 图2

nginx