Robots.txt生成器 在线生成与测试爬虫规则
覆盖Googlebot、Bingbot等主流与AI爬虫,配置User-agent、Allow、Disallow和Sitemap规则,生成robots文件部署。
更新于 2026-08-26
相关工具
功能特性
- 生成包含多个 User-agent 组的 robots.txt,针对不同爬虫设置规则
- 添加 Allow 和 Disallow 规则,控制爬虫可访问的路径
- 支持主流搜索引擎爬虫:Googlebot、Bingbot、Baiduspider 和全部爬虫 (*)
- AI 爬虫预设:GPTBot、ClaudeBot、Google-Extended、CCBot 等
- 自定义 User-agent 输入,适配任意爬虫类型
- 预设模板:标准、阻止 AI 训练、WordPress、电商、严格模式
- URL 路径测试工具:模拟指定爬虫对路径的访问权限
- Crawl-delay 指令控制爬取频率,降低服务器负载
- Sitemap URL 指令帮助爬虫发现网站内容
- 规则构建时实时预览输出,无需点击生成按钮
- 复制或下载最终文件:一键复制带视觉反馈,或保存为 .txt 文件直接部署
- 输出格式符合官方 robots.txt 标准 (RFC 9309) 的语法
使用方法
- 1从预设中选择 User-agent(Googlebot、Bingbot 或任意 AI 爬虫),或输入自定义名称。
- 2输入要允许或禁止的路径(例如 /admin/、/private/、/public/)。
- 3选择 Allow(允许)或 Disallow(禁止):Disallow 阻止爬虫访问该路径,Allow 覆盖更宽泛的 Disallow。
- 4点击「添加规则」将规则加入列表。根据需求重复添加多条规则。
- 5切换到「模板」标签页快速加载预设配置(阻止 AI 训练、WordPress、电商等)。
- 6切换到「URL 测试」标签页模拟指定爬虫对 URL 路径的访问权限。
- 7可选设置 Crawl-delay 值(秒),限制爬虫请求频率。
- 8添加一个或多个 Sitemap URL,指向您的 XML 站点地图。
- 9复制生成的 robots.txt 粘贴到网站根目录,或保存为 .txt 文件。
常见问题
什么是 robots.txt 文件?
robots.txt 是放置在网站根目录的纯文本文件,用于告知搜索引擎爬虫可以或不能访问哪些页面或目录。它遵循 Robots Exclusion Standard,使用 User-agent、Disallow 和 Allow 等指令。爬虫访问您的网站时,会首先检查 robots.txt 以确定可访问的 URL。
路径中可以使用通配符或模式匹配吗?
可以。robots.txt 标准支持通配符:'*' 匹配任意字符序列,'$' 匹配 URL 结尾。例如 'Disallow: /*.pdf$' 阻止所有 PDF 文件,'Disallow: /private/*' 阻止 /private/ 下所有内容。但并非所有搜索引擎都支持所有模式,因此尽量保持简单。
什么是 Crawl-delay?如何使用?
Crawl-delay 告诉搜索引擎爬虫在两次请求之间等待指定的秒数。这有助于降低爬取期间的服务器负载。注意 Googlebot 会忽略 Crawl-delay,请改用 Google Search Console 的抓取速率设置。Bingbot 和 Baiduspider 等其他爬虫可能会遵守它。
应该在 robots.txt 中添加 Sitemap 指令吗?
是的。在 robots.txt 中添加 Sitemap 指令有助于爬虫更快发现您的 XML 站点地图。sitemap URL 应为完整绝对地址(如 https://example.com/sitemap.xml)。您可以为不同站点地图文件(页面、图片、新闻等)添加多个 Sitemap 指令。
如何测试 robots.txt 是否生效?
大多数搜索引擎提供测试工具。Google Search Console 有 robots.txt 测试工具,可查看 Googlebot 如何解读您的文件。您也可以在浏览器中直接访问 https://yourdomain.com/robots.txt 查看。本工具内置 URL 测试器,使用「URL 测试」标签页可模拟任意爬虫对当前规则的访问结果。
robots.txt 能用于安全保护吗?
不能。robots.txt 是对守规矩的爬虫的自愿性指导,并不强制执行访问限制。恶意爬虫或采集器会完全忽略它。切勿将敏感数据藏在 Disallow 指令后面。安全性应使用身份验证和服务端访问控制来实现。
robots.txt 会影响 SEO 排名吗?
间接影响。正确配置的 robots.txt 确保搜索引擎爬取和索引您的重要页面,同时忽略低价值部分(管理后台、搜索结果、标签页面)。误屏蔽重要页面可能导致它们无法出现在搜索结果中。部署前务必仔细检查规则。
如果没有 robots.txt 文件会怎样?
搜索引擎将不受限制地爬取您的整个网站。这对于大多数小型网站来说没有问题,但大型网站应利用 robots.txt 来节约爬取预算,将爬虫从重复、低质或低价值的页面引导到最重要的内容上。
应该阻止哪些 AI 爬虫?
常见的 AI 训练爬虫包括 GPTBot(OpenAI)、ClaudeBot(Anthropic)、Google-Extended(Gemini/Bard)、CCBot(Common Crawl)和 Bytespider(字节跳动)。如果您不希望内容用于 AI 模型训练,请为这些爬虫添加 Disallow 规则。AI 搜索爬虫如 ChatGPT-User 和 PerplexityBot 也可根据需要屏蔽。使用本工具的「阻止 AI 训练」模板可快速配置。
如何使用模板?
切换到「模板」标签页,从预设配置中选择:标准(允许所有)、阻止 AI 训练(禁止 AI 训练爬虫)、WordPress(禁用管理路径)、电商(禁用购物车/结算路径)和严格(仅允许首页和站点地图)。每个模板会自动填充规则、Crawl-delay 和 Sitemap。您可以在「规则」标签页中进一步自定义。
我的robots.txt为什么不生效?
最常见的原因是缓存或语法错误。检查:文件必须放在域名根目录,每条规则独占一行,Disallow路径要精确匹配。Google会缓存robots.txt最多24小时,修改后需要时间生效。可以在Search Console的robots.txt测试工具里验证结果。
robots.txt和meta robots noindex有什么区别?
robots.txt阻止抓取(爬虫不下载页面),meta robots noindex阻止收录(爬虫下载但不存储)。如果用robots.txt屏蔽页面,Google仍可能只索引URL没有内容。要从搜索结果移除页面,应该用noindex。
WordPress 里怎么配置 robots.txt?需要手动建文件吗?
WordPress 会动态生成虚拟 robots.txt,通常根本不需要物理文件。不配置时,WP 默认允许一切,只禁止 /wp-admin/ 和 /wp-includes/。要自定义,用 SEO 插件(Rank Math、Yoast、AIOSEO)或主题 functions.php 里的 robots_txt 过滤器钩子。如果你确实上传了物理 robots.txt,它会完全覆盖虚拟文件,很多人改完插件设置发现不生效,就是这个原因。
我误加了 Disallow: / 把整个网站屏蔽了,怎么恢复?
先改掉文件(删掉该规则或收窄到真实路径)。搜索引擎会频繁重新抓取 robots.txt,Google 至少每 24 小时重查一次,所以恢复通常以小时计而不是以天计。然后用 Search Console 的网址检查工具对你最重要的页面提交抓取请求。全站屏蔽真正的杀伤不是暂停抓取,而是被降索引:页面长期无法被 Googlebot 抓取可能从索引中消失,所以尽快修复,下次部署前先用本工具的 URL 测试验证。