robots.txt写法 - 检查前需要准备哪些信息

📍 WDQWDWQD987AAAAA:216.73.217.35
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /e7a536507f5a.html
📄

robots.txt写法 - 检查前需要准备哪些信息

检查一份 robots.txt 写法是否正确,动手前至少要准备好四类信息:站点真实 URL 结构、需要放行或屏蔽的具体路径、目标搜索引擎对语法的支持情况,以及修改后的验证与回滚方式。缺少其中任何一项,检查都会变成凭感觉判断。

先明确要交付什么结果,再倒推资料

检查 robots.txt 的最终交付物通常是一份可上线的规则文件,外加一份说明:哪些路径被允许、哪些被禁止、依据是什么。围绕这个结果,需要准备的资料包括:

这些资料的作用是让每一条规则都能对应到一个真实 URL,而不是凭印象添加。

两种处理方案的适用条件

检查时常见的分歧是:用 Disallow 屏蔽路径,还是用 Allow 在已屏蔽目录中开一个口子。两者适用条件不同。

判断方法是:先问“这个路径是否必须被抓取”。必须抓取就放行,不必抓取就屏蔽,两者都不确定时先保持现状,不要贸然改动。

动手前必须核对的检查项

准备好资料后,按以下顺序核对,可以避免大部分低级错误:

  1. 确认文件名和位置:必须是根目录下的 robots.txt,子目录中的同名文件无效。
  2. 确认语法:每行一条指令,字段名区分大小写,路径区分大小写。
  3. 确认没有整站误封:检查是否存在 Disallow: / 且没有对应的 Allow 例外。
  4. 确认关键资源可抓取:CSS、JS 目录若被屏蔽,可能影响渲染判断。
  5. 确认站点地图声明:Sitemap: 行使用完整 URL,且该地址可以访问。

其中“整站误封”是最需要优先排查的一项,一旦上线,影响范围最大。

验证与责任分工

规则写完后,验证环节需要明确谁来做、用什么方式做。可执行的做法是:

需要提醒的是,robots.txt 的抓取限制不等于可靠的索引移除。如果页面已被收录,仅靠屏蔽抓取通常无法让它从搜索结果中消失,这种情况需要配合其他移除手段,并分别核查各搜索引擎的支持情况。

下一步建议先把当前线上 robots.txt 完整保存一份作为回滚基线,再对照上面的检查项逐条核对,确认无误后再提交修改。

图1 图2

nginx