改版或迁移时,robots txt文件最先要核对的是:新站是否仍允许抓取重要栏目,旧站的限制规则是否被原样带到了新环境,以及被屏蔽的路径是否已经不存在或不再需要屏蔽。时间和人手有限时,优先检查整站禁止抓取、旧目录屏蔽和规则指向的路径是否有效这三类问题,因为它们会直接影响搜索引擎能否发现新页面。
假设某站点从旧域名迁移到新域名,运维人员把旧站的robots txt文件直接复制到新站根目录。旧文件里有一条规则屏蔽了/old/目录,但新站把重要内容放在/old/之外的新路径下,同时新站又新增了一条Disallow: /用于测试,测试结束后忘记删除。此时搜索引擎抓取新站时可能无法进入任何页面。这个例子是假设,不是真实项目结果,但它对应了迁移中最常见的两类错误:把旧规则当成通用规则,以及临时规则没有清理。
核对步骤可以这样安排:
Disallow: /。如果存在,判断它是否仍然符合当前需求;若只是测试残留,应删除或改成精确路径。Disallow后面的路径,在新站中是否真实存在。旧目录已经不存在时,对应规则可以删除;旧目录仍存在但需要保留访问时,则要重新评估。Sitemap行指向的地址是否为新站可访问的站点地图。站点地图不保证收录,但地址写错会让发现入口失效。Disallow: /时,要确认是故意限制全部抓取,还是测试后忘记删除。Sitemap行应指向实际可访问的地址;写错协议或域名会导致读取失败。如果新站robots txt文件允许抓取主要栏目,没有整站屏蔽,Sitemap地址可访问,且被屏蔽路径与当前业务需求一致,可以视为通过。若发现整站屏蔽、重要目录被误屏蔽、站点地图地址错误,应优先处理,因为它们会直接妨碍新页面被发现。若只是屏蔽了确实不需要抓取的旧目录或后台路径,可以按低优先级处理。不同搜索引擎对robots txt的支持细节可能存在差异,涉及具体搜索引擎时,应分别查看其官方文档中的抓取规则说明。
先处理会影响全站抓取的规则,再处理影响栏目级发现的规则,最后清理无效或过期的旧规则。改版或迁移完成后,不要只检查一次;在新站上线后的一段时间内,重新请求robots txt文件并确认内容没有被服务器配置、CDN或重定向改写。HTTPS不保证安全无漏洞或排名,它只是传输层配置,不能替代对robots txt文件本身的核对。
下一步可以直接打开新站根目录下的robots txt文件,按上面的清单逐行标记:保留、删除或修改。对拿不准的规则,先查该路径在新站中是否真实存在,再决定是否继续屏蔽。