只有当 AI 爬虫真的能够抓取并渲染内容时,制作高质量、结构良好的内容对 GEO 才有意义。一条放错位置的 robots.txt 指令、一套重度依赖 JavaScript 的渲染方案,或者一份缺失的 llms.txt 文件,都可能悄无声息地把您的整个网站排除在各大 AI 引擎的训练和检索链路之外。上方的工具会审计您提供的域名,检查 GPTBot、OAI-SearchBot、PerplexityBot、Google-Extended 和 ClaudeBot 等主要 AI 爬虫能否访问您的页面并正确处理它们。
审计会检查什么
上方的工具会从四个主要方面评估可抓取性:
- Robots.txt 指令:审计会读取您的 robots.txt 文件,找出哪些 AI 爬虫 user-agent 被明确屏蔽、被通配规则误伤,或者根本没有出现在任何放行清单中。它还会检查文件本身是否可访问、格式是否正确,以及是否超出部分爬虫强制执行的 500 KB 上限。
- Meta robots 与 X-Robots-Tag 响应头:即使 robots.txt 允许抓取,如果单个页面带有
noindex或noarchive元标签,或者服务器响应头指示机器人跳过该页面,那也是不够的。审计会同时检查这两处来源。 - 对 JavaScript 渲染的依赖:只通过 JavaScript 输出关键内容的页面,对不执行脚本的爬虫来说是不可见的。审计会检测您页面上的主要内容是存在于原始 HTML 中,还是只有在客户端渲染之后才出现。
- 站点地图与 llms.txt:维护良好的 sitemap.xml 能帮助 AI 爬虫高效发现页面。较新的 llms.txt 标准以 robots.txt 为蓝本,但专为大语言模型设计,让您可以声明网站中哪些板块适合 AI 使用,并以机器可读的方式概述内容。审计会检查这两个文件是否存在、格式是否正确。
如何解读结果并采取行动
上方的工具会为每个问题标注严重级别。修复的优先顺序如下:
- robots.txt 中被屏蔽的 AI 爬虫:删除或收窄屏蔽相关 user-agent 的指令。如果您出于授权原因有意屏蔽所有 AI 爬虫,请确认这确实是一个深思熟虑的政策决定,而不是沿用 CMS 模板留下的通配屏蔽。
- 关键页面上的 noindex:逐一检查被标记的页面。如果页面包含您希望被引用的有价值内容,请去掉 noindex 指令。如果页面是有意排除的,请核实这个屏蔽确实是有意为之,而不是上线后遗留的测试环境指令。
- 只有 JavaScript 才能呈现的内容:对希望被 AI 爬虫收录的内容,请采用服务器端渲染(SSR)或静态站点生成(SSG)。至少要确保页面标题、各级标题和正文的前 200 个词,在 JavaScript 执行之前就出现在服务器渲染的 HTML 中。
- 站点地图缺失或过期:重新生成一份 sitemap.xml,包含所有规范网址,排除已跳转或带 noindex 的页面,并在 robots.txt 中引用它。每次发布新内容时都要自动更新。
- 没有 llms.txt 文件:在域名根目录创建一份 llms.txt。至少要写上网站的简要说明、涵盖的主要主题,以及指向最重要页面的链接。这是一个投入很小的信号,却能明显改善 AI 爬虫对您网站的归类方式。
关于 AI 抓取权限的一组基准数据
AI Overviews 目前出现在约 31% 的 Google 查询中,而排在 AI Overviews 之下的第1名页面最多会损失 58% 的预期点击(Ahrefs,2025年)。承接这部分转移流量的,正是那些被 AI 答案引用的页面。可抓取性是前提:如果 AI 机器人访问不到您的内容,再多的页面内优化也换不来一次引用。因此,扫清抓取障碍是任何 GEO 策略中收益最高的起点。
如果需要在各大 AI 引擎上持续监测您的 AI 可抓取性和引用表现,Sorank 会跟踪您的 GEO 曝光度,并在访问权限发生变化时提醒您。

























