Robots.txt 生成器 — 在线创建爬虫访问规则
在线生成 robots.txt,控制爬虫抓取。设置 User-agent、Allow、Disallow 和 Sitemap。浏览器本地处理,不上传。
功能特性
- ✓生成包含多个 User-agent 组的 robots.txt,针对不同爬虫设置规则
- ✓添加 Allow 和 Disallow 规则,控制爬虫可访问的路径
- ✓支持主流搜索引擎爬虫:Googlebot、Bingbot、Baiduspider 和全部爬虫 (*)
- ✓AI 爬虫预设:GPTBot、ClaudeBot、Google-Extended、CCBot 等
- ✓自定义 User-agent 输入,适配任意爬虫类型
- ✓预设模板:标准、阻止 AI 训练、WordPress、电商、严格模式
- ✓URL 路径测试工具 — 模拟指定爬虫对路径的访问权限
- ✓Crawl-delay 指令控制爬取频率,降低服务器负载
- ✓Sitemap URL 指令帮助爬虫发现网站内容
- ✓规则构建时实时预览输出,无需点击生成按钮
- ✓一键复制到剪贴板,带视觉反馈
- ✓保存 robots.txt 为 .txt 文件,直接部署
- ✓所有处理在浏览器本地完成,零上传,完全隐私
- ✓输出格式符合官方 robots.txt 标准 (RFC 9309) 的语法
- ✓适用于 SEO 审计、网站上线和测试环境配置
使用方法
- 1从预设中选择 User-agent(Googlebot、Bingbot 或任意 AI 爬虫),或输入自定义名称。
- 2输入要允许或禁止的路径(例如 /admin/、/private/、/public/)。
- 3选择 Allow(允许)或 Disallow(禁止)——Disallow 阻止爬虫访问该路径,Allow 覆盖更宽泛的 Disallow。
- 4点击「添加规则」将规则加入列表。根据需求重复添加多条规则。
- 5切换到「模板」标签页快速加载预设配置(阻止 AI 训练、WordPress、电商等)。
- 6切换到「URL 测试」标签页模拟指定爬虫对 URL 路径的访问权限。
- 7可选设置 Crawl-delay 值(秒),限制爬虫请求频率。
- 8添加一个或多个 Sitemap URL,指向您的 XML 站点地图。
- 9复制生成的 robots.txt 粘贴到网站根目录,或保存为 .txt 文件。
常见问题
什么是 robots.txt 文件?
∨
robots.txt 是放置在网站根目录的纯文本文件,用于告知搜索引擎爬虫可以或不能访问哪些页面或目录。它遵循 Robots Exclusion Standard,使用 User-agent、Disallow 和 Allow 等指令。爬虫访问您的网站时,会首先检查 robots.txt 以确定可访问的 URL。
路径中可以使用通配符或模式匹配吗?
∨
可以。robots.txt 标准支持通配符:'*' 匹配任意字符序列,'$' 匹配 URL 结尾。例如 'Disallow: /*.pdf$' 阻止所有 PDF 文件,'Disallow: /private/*' 阻止 /private/ 下所有内容。但并非所有搜索引擎都支持所有模式,因此尽量保持简单。
什么是 Crawl-delay?如何使用?
∨
Crawl-delay 告诉搜索引擎爬虫在两次请求之间等待指定的秒数。这有助于降低爬取期间的服务器负载。注意 Googlebot 会忽略 Crawl-delay,请改用 Google Search Console 的抓取速率设置。Bingbot 和 Baiduspider 等其他爬虫可能会遵守它。
应该在 robots.txt 中添加 Sitemap 指令吗?
∨
是的。在 robots.txt 中添加 Sitemap 指令有助于爬虫更快发现您的 XML 站点地图。sitemap URL 应为完整绝对地址(如 https://example.com/sitemap.xml)。您可以为不同站点地图文件(页面、图片、新闻等)添加多个 Sitemap 指令。
如何测试 robots.txt 是否生效?
∨
大多数搜索引擎提供测试工具。Google Search Console 有 robots.txt 测试工具,可查看 Googlebot 如何解读您的文件。您也可以在浏览器中直接访问 https://yourdomain.com/robots.txt 查看。本工具内置 URL 测试器 — 使用「URL 测试」标签页可模拟任意爬虫对当前规则的访问结果。
robots.txt 能用于安全保护吗?
∨
不能。robots.txt 是对守规矩的爬虫的自愿性指导,并不强制执行访问限制。恶意爬虫或采集器会完全忽略它。切勿将敏感数据藏在 Disallow 指令后面。安全性应使用身份验证和服务端访问控制来实现。
robots.txt 会影响 SEO 排名吗?
∨
间接影响。正确配置的 robots.txt 确保搜索引擎爬取和索引您的重要页面,同时忽略低价值部分(管理后台、搜索结果、标签页面)。误屏蔽重要页面可能导致它们无法出现在搜索结果中。部署前务必仔细检查规则。
如果没有 robots.txt 文件会怎样?
∨
搜索引擎将不受限制地爬取您的整个网站。这对于大多数小型网站来说没有问题,但大型网站应利用 robots.txt 来节约爬取预算 — 将爬虫从重复、低质或低价值的页面引导到最重要的内容上。
应该阻止哪些 AI 爬虫?
∨
常见的 AI 训练爬虫包括 GPTBot(OpenAI)、ClaudeBot(Anthropic)、Google-Extended(Gemini/Bard)、CCBot(Common Crawl)和 Bytespider(字节跳动)。如果您不希望内容被用于 AI 模型训练,请为这些爬虫添加 Disallow 规则。AI 搜索爬虫如 ChatGPT-User 和 PerplexityBot 也可根据需要屏蔽。使用本工具的「阻止 AI 训练」模板可快速配置。
如何使用模板?
∨
切换到「模板」标签页,从预设配置中选择:标准(允许所有)、阻止 AI 训练(禁止 AI 训练爬虫)、WordPress(禁用管理路径)、电商(禁用购物车/结算路径)和严格(仅允许首页和站点地图)。每个模板会自动填充规则、Crawl-delay 和 Sitemap。您可以在「规则」标签页中进一步自定义。