偏好设置

我们非常重视您的隐私,因此您可以选择禁用某些对网站基本功能并非必要的存储类型。屏蔽某些类别可能会影响您的网站使用体验。更多信息

接受所有 Cookie

网站可抓取性 AI 审计:AI 机器人真的能访问您的网站吗?

检查 AI 爬虫能否访问并渲染您的网站。发现 robots.txt 屏蔽、JavaScript 问题、站点地图缺口,以及其他阻碍 AI 收录的障碍。

Sorank 创始人 Thibault Besson-Magdelain

关于作者

Thibault Besson-Magdelain

Sorank 创始人,拥有 5 年以上 SEO 经验,GEO 爱好者。

Learn everything to know on 网站可抓取性 AI 审计 !

创建于
4/9/26
最后更新:
4/9/26
网站可抓取性 AI 审计界面,显示 AI 机器人的抓取访问结果和屏蔽问题

只有当 AI 爬虫真的能够抓取并渲染内容时,制作高质量、结构良好的内容对 GEO 才有意义。一条放错位置的 robots.txt 指令、一套重度依赖 JavaScript 的渲染方案,或者一份缺失的 llms.txt 文件,都可能悄无声息地把您的整个网站排除在各大 AI 引擎的训练和检索链路之外。上方的工具会审计您提供的域名,检查 GPTBot、OAI-SearchBot、PerplexityBot、Google-Extended 和 ClaudeBot 等主要 AI 爬虫能否访问您的页面并正确处理它们。

审计会检查什么

上方的工具会从四个主要方面评估可抓取性:

  • Robots.txt 指令:审计会读取您的 robots.txt 文件,找出哪些 AI 爬虫 user-agent 被明确屏蔽、被通配规则误伤,或者根本没有出现在任何放行清单中。它还会检查文件本身是否可访问、格式是否正确,以及是否超出部分爬虫强制执行的 500 KB 上限。
  • Meta robots 与 X-Robots-Tag 响应头:即使 robots.txt 允许抓取,如果单个页面带有 noindexnoarchive 元标签,或者服务器响应头指示机器人跳过该页面,那也是不够的。审计会同时检查这两处来源。
  • 对 JavaScript 渲染的依赖:只通过 JavaScript 输出关键内容的页面,对不执行脚本的爬虫来说是不可见的。审计会检测您页面上的主要内容是存在于原始 HTML 中,还是只有在客户端渲染之后才出现。
  • 站点地图与 llms.txt:维护良好的 sitemap.xml 能帮助 AI 爬虫高效发现页面。较新的 llms.txt 标准以 robots.txt 为蓝本,但专为大语言模型设计,让您可以声明网站中哪些板块适合 AI 使用,并以机器可读的方式概述内容。审计会检查这两个文件是否存在、格式是否正确。

如何解读结果并采取行动

上方的工具会为每个问题标注严重级别。修复的优先顺序如下:

  • robots.txt 中被屏蔽的 AI 爬虫:删除或收窄屏蔽相关 user-agent 的指令。如果您出于授权原因有意屏蔽所有 AI 爬虫,请确认这确实是一个深思熟虑的政策决定,而不是沿用 CMS 模板留下的通配屏蔽。
  • 关键页面上的 noindex:逐一检查被标记的页面。如果页面包含您希望被引用的有价值内容,请去掉 noindex 指令。如果页面是有意排除的,请核实这个屏蔽确实是有意为之,而不是上线后遗留的测试环境指令。
  • 只有 JavaScript 才能呈现的内容:对希望被 AI 爬虫收录的内容,请采用服务器端渲染(SSR)或静态站点生成(SSG)。至少要确保页面标题、各级标题和正文的前 200 个词,在 JavaScript 执行之前就出现在服务器渲染的 HTML 中。
  • 站点地图缺失或过期:重新生成一份 sitemap.xml,包含所有规范网址,排除已跳转或带 noindex 的页面,并在 robots.txt 中引用它。每次发布新内容时都要自动更新。
  • 没有 llms.txt 文件:在域名根目录创建一份 llms.txt。至少要写上网站的简要说明、涵盖的主要主题,以及指向最重要页面的链接。这是一个投入很小的信号,却能明显改善 AI 爬虫对您网站的归类方式。

关于 AI 抓取权限的一组基准数据

AI Overviews 目前出现在约 31% 的 Google 查询中,而排在 AI Overviews 之下的第1名页面最多会损失 58% 的预期点击(Ahrefs,2025年)。承接这部分转移流量的,正是那些被 AI 答案引用的页面。可抓取性是前提:如果 AI 机器人访问不到您的内容,再多的页面内优化也换不来一次引用。因此,扫清抓取障碍是任何 GEO 策略中收益最高的起点。

如果需要在各大 AI 引擎上持续监测您的 AI 可抓取性和引用表现,Sorank 会跟踪您的 GEO 曝光度,并在访问权限发生变化时提醒您。

常见问题解答

我应该在 robots.txt 中放行哪些 AI 爬虫的 user-agent?

需要留意的主要 AI 爬虫 user-agent 有:GPTBot(OpenAI 训练)、OAI-SearchBot(SearchGPT 检索)、PerplexityBot(Perplexity)、Google-Extended(Google 的 AI 训练和 Gemini)、ClaudeBot(Anthropic)和 Meta-ExternalAgent(Meta AI)。如果没有特定的授权方面的理由要屏蔽它们,全部放行能让您的 AI 曝光潜力最大化。

llms.txt 是什么?是必需的吗?

llms.txt 是一种正在形成的约定,类似 robots.txt,专门为大语言模型提供网站内容和结构的纯文本概要。它不是强制标准,但作为一个成本极低的信号,能帮助 AI 系统理解您网站的定位、找出最重要的页面。任何认真做 GEO 的网站都建议创建一份。

屏蔽 Googlebot 是否也会屏蔽 Google 的 AI 爬虫?

不会。用于 AI 训练和 Gemini 的 Google-Extended 与 Googlebot 是两个不同的 user-agent。您可以屏蔽 Google-Extended 而不影响常规的 Google 搜索收录,反之亦然。请始终在 robots.txt 中明确写出 user-agent,不要依赖可能无意中覆盖多个爬虫的通配规则。

其他免费 SEO 工具