偏好设置

我们非常重视您的隐私,因此您可以选择禁用某些对网站基本功能并非必要的存储类型。屏蔽某些类别可能会影响您的网站使用体验。更多信息

接受所有 Cookie

Robots.txt 检查工具:验证语法与 AI 爬虫访问权限

即时检查 robots.txt 语法。在损害 AI 搜索可见度之前,发现针对 GPTBot、PerplexityBot 和 Google-Extended 的拦截错误。

Sorank 创始人 Thibault Besson-Magdelain

关于作者

Thibault Besson-Magdelain

Sorank 创始人,拥有 5 年以上 SEO 经验,GEO 爱好者。

Learn everything to know on Robots.txt 检查工具 !

创建于
4/9/26
最后更新:
4/9/26
Robots.txt 检查工具界面,显示爬虫指令分析和 AI 机器人访问状态

Robots.txt 检查工具会抓取并解析任意域名的 robots.txt 文件,验证其语法,并突出显示影响 GPTBot、PerplexityBot、Google-Extended 等 AI 爬虫的指令。在上方工具中输入您的域名即可立即获得分析结果。

Robots.txt 基础知识,以及 AI 爬虫带来的新变化

Robots.txt 是位于域名根目录下的纯文本文件,用于告知爬虫哪些路径可以访问、哪些不可以。多年来,站长主要为 Googlebot 和 Bingbot 编写规则。AI 搜索引擎的兴起带来了一类新的机器人,每一个都有自己的 user-agent,必须明确地允许或屏蔽。

常见的 AI 爬虫 user-agent 包括:GPTBot(OpenAI/ChatGPT)、PerplexityBot(Perplexity)、Google-Extended(Google AI 训练与 Gemini 功能)、ClaudeBot(Anthropic)以及 OAI-SearchBot(OpenAI 网页搜索)。如果您的 robots.txt 对 User-agent: * 使用了一刀切的 Disallow: /,那么除非单独重新放行,否则这些爬虫都会被屏蔽。

上方工具会检查什么

  • 语法有效性:检测格式错误的指令、代理区块之间缺失的空行,以及不受支持的字段。
  • AI 机器人访问权限:针对每一个主流 AI 爬虫,工具会报告它是被允许、部分允许还是完全屏蔽。
  • Crawl-delay 指令:过长的延迟会拖慢 AI 收录,工具会标记超出推荐阈值的数值。
  • Sitemap 声明:检查是否存在指向有效 XML 站点地图的 Sitemap 行。
  • 通配符写法:验证 *$ 通配符的使用,某些解析器对它们的理解并不一致。
  • 规则冲突:当更具体的规则与更宽泛的规则相互矛盾时,工具会说明哪条指令优先。

如何解读结果并采取行动

  • 如果 GPTBot 或 PerplexityBot 被屏蔽:请判断这是否出于本意。如果您希望获得 AI 搜索可见度,请在对应的 user-agent 区块下加入明确的 Allow: /,或移除一刀切的屏蔽规则。
  • 如果 Google-Extended 被屏蔽:您的页面可能被排除在 Gemini 的知识范围之外,也无法进入依赖 Google AI 训练语料的功能。请仔细权衡利弊。
  • 不要盲目移除所有限制。屏蔽抓取工具和内容盗用者是合理的。请让限制更有针对性:屏蔽特定的机器人或路径,而不是所有爬虫。
  • 每次修改后,请重新运行上方工具,在正式上线前确认改动已正确生效。
  • 将 robots.txt 与格式规范的 llms.txt 结合使用,既给 AI 爬虫授权,也为它们提供一张导航地图。

参照数据:一个被屏蔽的机器人,就等于在整个平台上隐形

目前约 31% 的 Google 查询会出现 AI Overviews。一行针对 Google-Extended 的错误 Disallow 就足以让您的页面被完全排除在 Gemini 的答案候选之外。同样,屏蔽 GPTBot 意味着 ChatGPT 的联网浏览功能在抓取时无法读取您的内容。代价是不对称的:修复一条 robots.txt 规则只需几分钟,而恢复失去的 AI 可见度需要数周。

如需持续监测您的品牌在各大引擎 AI 答案中的表现,Sorank 会自动追踪引用与可见度。

常见问题解答

屏蔽 GPTBot 会影响我在 Google 的排名吗?

不会。GPTBot 是 OpenAI 的爬虫,对 Google 的自然排名没有任何影响。屏蔽它只会阻止 ChatGPT 收录您的内容。Google 自己的 AI 相关爬虫是 Google-Extended。

我应该始终允许所有 AI 爬虫吗?

不一定。如果网站内容被 AI 使用会给您带来法律或竞争上的顾虑,有选择地屏蔽是合理的。关键在于主动做出决定,而不是因为一条笼统的通用规则而误屏蔽。

如果我的 robots.txt 存在语法错误会怎样?

大多数爬虫比较宽容,会跳过无效的行,但具体行为各不相同。有些机器人可能会在文件格式错误时忽略整个文件。请及时修复语法错误,确保您设定的规则得到执行。

其他免费 SEO 工具