Robots.txt 检查工具会抓取并解析任意域名的 robots.txt 文件,验证其语法,并突出显示影响 GPTBot、PerplexityBot、Google-Extended 等 AI 爬虫的指令。在上方工具中输入您的域名即可立即获得分析结果。
Robots.txt 基础知识,以及 AI 爬虫带来的新变化
Robots.txt 是位于域名根目录下的纯文本文件,用于告知爬虫哪些路径可以访问、哪些不可以。多年来,站长主要为 Googlebot 和 Bingbot 编写规则。AI 搜索引擎的兴起带来了一类新的机器人,每一个都有自己的 user-agent,必须明确地允许或屏蔽。
常见的 AI 爬虫 user-agent 包括:GPTBot(OpenAI/ChatGPT)、PerplexityBot(Perplexity)、Google-Extended(Google AI 训练与 Gemini 功能)、ClaudeBot(Anthropic)以及 OAI-SearchBot(OpenAI 网页搜索)。如果您的 robots.txt 对 User-agent: * 使用了一刀切的 Disallow: /,那么除非单独重新放行,否则这些爬虫都会被屏蔽。
上方工具会检查什么
- 语法有效性:检测格式错误的指令、代理区块之间缺失的空行,以及不受支持的字段。
- AI 机器人访问权限:针对每一个主流 AI 爬虫,工具会报告它是被允许、部分允许还是完全屏蔽。
- Crawl-delay 指令:过长的延迟会拖慢 AI 收录,工具会标记超出推荐阈值的数值。
- Sitemap 声明:检查是否存在指向有效 XML 站点地图的 Sitemap 行。
- 通配符写法:验证
*和$通配符的使用,某些解析器对它们的理解并不一致。 - 规则冲突:当更具体的规则与更宽泛的规则相互矛盾时,工具会说明哪条指令优先。
如何解读结果并采取行动
- 如果 GPTBot 或 PerplexityBot 被屏蔽:请判断这是否出于本意。如果您希望获得 AI 搜索可见度,请在对应的 user-agent 区块下加入明确的
Allow: /,或移除一刀切的屏蔽规则。 - 如果 Google-Extended 被屏蔽:您的页面可能被排除在 Gemini 的知识范围之外,也无法进入依赖 Google AI 训练语料的功能。请仔细权衡利弊。
- 不要盲目移除所有限制。屏蔽抓取工具和内容盗用者是合理的。请让限制更有针对性:屏蔽特定的机器人或路径,而不是所有爬虫。
- 每次修改后,请重新运行上方工具,在正式上线前确认改动已正确生效。
- 将 robots.txt 与格式规范的 llms.txt 结合使用,既给 AI 爬虫授权,也为它们提供一张导航地图。
参照数据:一个被屏蔽的机器人,就等于在整个平台上隐形
目前约 31% 的 Google 查询会出现 AI Overviews。一行针对 Google-Extended 的错误 Disallow 就足以让您的页面被完全排除在 Gemini 的答案候选之外。同样,屏蔽 GPTBot 意味着 ChatGPT 的联网浏览功能在抓取时无法读取您的内容。代价是不对称的:修复一条 robots.txt 规则只需几分钟,而恢复失去的 AI 可见度需要数周。
如需持续监测您的品牌在各大引擎 AI 答案中的表现,Sorank 会自动追踪引用与可见度。

























