偏好设置

我们非常重视您的隐私,因此您可以选择禁用某些对网站基本功能并非必要的存储类型。屏蔽某些类别可能会影响您的网站使用体验。更多信息

接受所有 Cookie

适用于任何网站的免费 Robots.txt 生成器

几秒内创建 Robots.txt 文件。控制搜索引擎抓取,屏蔽私密页面。

Initialisation de l'outil...

Sorank 创始人 Thibault Besson-Magdelain

关于作者

Thibault Besson-Magdelain

Sorank 创始人,拥有 5 年以上 SEO 经验,GEO 爱好者。

Learn everything to know on Robots 生成器 !

创建于
4/9/26
最后更新:
4/9/26
Robots.txt 生成器,包含允许与禁止规则、站点地图网址和抓取延迟设置

超过 25% 的网站存在 robots.txt 配置错误,导致关键页面被意外屏蔽在搜索引擎之外。

robots.txt 文件是搜索引擎抓取工具访问您网站时读取的第一份文档。一条放错位置的指令,就可能让 Google 无法索引您最重要的页面,更糟的是可能暴露您本想保密的网址。sorank.com Robots.txt 生成器帮您在几秒内创建结构完整的 robots.txt 文件,确保抓取预算得到优化,并把站点架构准确地传达给每一个主要搜索引擎。

robots.txt 文件是什么,为何对 SEO 重要?

robots.txt 是一份放在网站根目录的纯文本文件(例如 https://example.com/robots.txt),它向网络抓取工具说明网站上哪些页面或区域应该或不应该被抓取。它遵循机器人排除协议,这一标准自 1994 年起就在规范抓取工具的行为。

robots.txt 并不直接控制索引(那是 meta robots 标签和规范标签的职责),但它在抓取预算管理中扮演着关键角色。对于拥有数千个页面的大型网站,告诉抓取工具跳过低价值区域,例如后台面板、重复内容或预发布环境,能确保最重要的页面更快被抓取和索引。

robots.txt 重要的主要原因:

  • 优化抓取预算,把抓取工具引向高优先级页面,而不是把资源浪费在无关网址上
  • 降低服务器负载,避免激进的机器人用不必要的请求压垮您的服务器
  • 保护隐私,阻止抓取工具访问内部工具、预发布站点或敏感目录
  • 发现站点地图,把搜索引擎指向您的 XML 站点地图,让抓取更高效

读懂 robots.txt 指令:完整参考

robots.txt 文件使用围绕几条核心指令构建的简单语法。掌握这些指令,是做好抓取控制的基础:

User-agent:指定规则适用于哪个抓取工具。用 * 表示所有抓取工具,或针对 GooglebotBingbotGPTBot 等具体机器人。

Disallow:告诉抓取工具不要访问特定路径。例如,Disallow: /admin/ 会屏蔽整个后台目录。

Allow:在被屏蔽的目录中,为特定路径覆盖 Disallow 规则。适合做精细控制,例如在屏蔽 /admin/ 其余部分的同时允许 /admin/public-page

Sitemap:声明您 XML 站点地图的位置。这条指令与抓取工具无关,能帮搜索引擎发现您全部可索引的网址。

Crawl-delay:设定抓取工具连续请求之间的延迟(以秒为单位)。Bing 和 Yandex 支持它,Google 则忽略它,而是依据 Search Console 的设置。

一份结构良好的 robots.txt 示例:

User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /search?
Allow: /admin/public/

User-agent: GPTBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

如何使用 Sorank Robots.txt 生成器

我们的免费 robots.txt 生成器用直观的界面简化了创建过程:

  1. 选择目标抓取工具,从常见抓取工具中选择(Googlebot、Bingbot、GPTBot 等),或用通配符 * 设定通用规则
  2. 定义 Disallow 规则,输入您想屏蔽的路径,例如 /wp-admin//staging/,或 /search? 这样的查询参数
  3. 添加 Allow 例外,如果需要允许访问被屏蔽目录中的特定页面,请添加 Allow 规则
  4. 填入站点地图网址,输入您 XML 站点地图的位置,让抓取工具能自动发现它
  5. 可选设置 Crawl-delay,如果服务器需要限速,可为支持该指令的抓取工具配置延迟值
  6. 生成并下载,复制生成的 robots.txt 或直接下载,然后上传到网站根目录

损害 SEO 的常见 robots.txt 错误

即使是经验丰富的站长,也会犯下严重影响搜索可见度的 robots.txt 错误:

1. 屏蔽 CSS 和 JavaScript 文件:Google 需要渲染页面才能理解内容。屏蔽 /css//js/ 目录会让 Googlebot 无法渲染您的页面,可能严重损害排名。

2. 用 robots.txt 把页面从索引中藏起来:Disallow 指令并不会把页面从 Google 的索引中移除,它只阻止抓取。如果其他网站链接了被屏蔽的页面,Google 仍可能索引该网址(只是没有摘要)。请改用 noindex 元标签。

3. 意外屏蔽整个站点:User-agent: * 下写一条 Disallow: /,就会把所有抓取工具挡在整个站点之外。请务必反复核对通配符规则。

4. 忘写末尾斜杠:Disallow: /admin 会屏蔽任何以 /admin 开头的网址,包括 /administration。请用 Disallow: /admin/ 以只屏蔽该目录。

5. 没有包含 Sitemap 指令:虽然不是必须,但在 robots.txt 中声明站点地图,能确保所有搜索引擎都能发现它,即使您没有通过它们各自的站长工具提交过。

6. 规则相互冲突:当 Allow 和 Disallow 规则重叠时,在 Google 的实现中更具体的规则优先。请始终测试您的配置,避免意外屏蔽。

不同 CMS 平台的 robots.txt 最佳实践

WordPress:屏蔽 /wp-admin/,但允许 /wp-admin/admin-ajax.php(前端功能必需)。千万不要屏蔽 /wp-content/uploads/,它存放着您的媒体文件。可以考虑屏蔽 /wp-includes/ 中的非必要脚本。

Webflow:Webflow 会自动生成一份 robots.txt,但您可以在站点设置中自定义它。请确认没有屏蔽集合页面或用于生成动态内容的模板路径。

Shopify:Shopify 有一份默认 robots.txt,会屏蔽 /admin/cart/checkout/orders 等内部路径。自 2021 年起,您可以通过 robots.txt.liquid 主题模板自定义它。

Next.js / React 单页应用:请确保 robots.txt 作为静态文件从 public 目录提供。对于服务器端渲染的应用,请确认 Googlebot 能访问渲染内容所需的全部接口。

用 robots.txt 管理 AI 抓取工具

随着 AI 模型大量采集网络内容,robots.txt 在控制 AI 抓取工具访问方面有了新的重要性:

  • GPTBot,OpenAI 用于采集训练数据的抓取工具
  • ChatGPT-User,OpenAI 用于实时浏览功能的抓取工具
  • Google-Extended,Google 的 AI 训练数据抓取工具(与 Googlebot 相互独立)
  • anthropic-ai,Anthropic 的网络抓取工具
  • CCBot,Common Crawl 的机器人,被许多 AI 训练数据集使用

在允许搜索引擎的同时屏蔽全部 AI 抓取工具:

User-agent: GPTBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: *
Allow: /

测试和校验您的 robots.txt

生成 robots.txt 文件后,请务必先校验再部署:

  • Google Search Console,使用“robots.txt 测试工具”(在抓取设置下)检查语法错误,并用具体网址测试您的规则
  • Bing Webmaster Tools,提供一个 robots.txt 分析器,展示 Bingbot 如何解读您的文件
  • 浏览器测试,直接访问 yourdomain.com/robots.txt,确认它可访问且格式正确
  • 日志文件分析,部署后监控服务器日志,确认抓取工具确实遵守了您的指令

请记住,搜索引擎会缓存您的 robots.txt 文件并定期刷新(通常每 24 小时一次)。修改后,您可以通过 Google Search Console 请求重新抓取,以更快生效。

使用 Sorank Robots.txt 生成器,几秒内就能创建一份格式规范的文件,无需任何编程知识。保护您的抓取预算、管理机器人访问,并确保站点上最有价值的页面得到搜索引擎应有的关注。

常见问题解答

robots.txt 文件是做什么的?

robots.txt 文件告诉搜索引擎抓取工具,它们可以和不可以访问您网站上的哪些页面。它控制的是抓取行为,但如果页面在其他地方被链接,它并不能阻止页面被索引。

错误的 robots.txt 会损害我的 SEO 吗?

绝对会。配置错误的 robots.txt 可能意外阻止 Google 抓取您最重要的页面,导致它们从搜索结果中彻底消失。部署前请务必测试。

我应该在 robots.txt 中屏蔽 AI 抓取工具吗?

这取决于您的目标。屏蔽 GPTBot 等 AI 抓取工具,能阻止您的内容被用于训练 AI 模型,但也可能降低您在 AI 搜索结果中的可见度。请仔细权衡利弊。

其他免费 SEO 工具