Robots.txt 生成工具 — 免费在线

生成 robots.txt 文件,支持为各爬虫设置自定义规则并附带站点地图引用。

结果仅供参考,可能包含错误。请自行核实重要信息。使用本工具风险自负。

这个工具能做什么

Robots.txt 生成工具用于创建 robots.txt 文件,告诉搜索引擎爬虫可以访问网站的哪些部分。选择允许所有爬虫或禁止所有爬虫,列出不希望被抓取的路径(每行一个,例如 /admin/),并填写 XML 站点地图的完整 URL。这些规则适用于所有爬虫(User-agent: *)。

把结果保存为名为 robots.txt 的纯文本文件,上传到域名根目录,使其可以通过 https://yourdomain.com/robots.txt 访问。爬虫在抓取其他任何内容之前都会先读取它。只有默认设置为允许时才会列出被屏蔽的路径,因为禁止所有爬虫本身已经涵盖了它们。

适用场景

  • 网站上线时向爬虫提供站点地图。
  • 禁止爬虫访问后台、购物车、搜索结果或内部 API 路径。
  • 完全禁止抓取预发布环境或测试网站。
  • 减少筛选结果 URL 或重复 URL 对抓取预算的浪费。

示例

输入

默认规则:允许所有爬虫
禁止访问的路径:/admin/, /cart/
站点地图 URL:https://example.com/sitemap.xml

输出

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /cart/

Sitemap: https://example.com/sitemap.xml

关于这个工具的问题

Disallow 能让页面不出现在 Google 中吗?

并不可靠。它只阻止抓取,被屏蔽的 URL 仍可能因为其他网站上的链接而被编入索引,只是没有描述。要让页面不出现在搜索结果中,应允许抓取,并添加 noindex robots 元标签或响应头。

robots.txt 是一种安全措施吗?

不是。它是一个公开文件,守规矩的爬虫只是自愿遵守。把机密路径写进去反而等于公开了它们。私密区域应通过身份验证来保护。

如何屏蔽 AI 训练爬虫?

为每个要排除的爬虫单独添加一组规则,例如 User-agent: GPTBot 后跟 Disallow: /。各公司都会公布其爬虫使用的 user-agent 名称。

如果屏蔽了整个预发布网站,上线时却沿用了同一个文件,会怎样?

那么正式网站也会被搜索引擎屏蔽。每次上线都要检查 robots.txt;残留的 Disallow: / 是流量突然下跌最常见的原因之一。

这个工具免费吗?

是的,完全免费。无需注册或电子邮箱。结果直接显示在本页。

如何获取结果?

在此页面使用工具即可查看结果,无需通过电子邮件接收。