Skip to main content
UFOZoo

Robots.txt生成器 在线生成与测试爬虫规则

覆盖Googlebot、Bingbot等主流与AI爬虫,配置User-agent、Allow、Disallow和Sitemap规则,生成robots文件部署。

更新于 2026-08-26

相关工具

功能特性

  • 生成包含多个 User-agent 组的 robots.txt,针对不同爬虫设置规则
  • 添加 Allow 和 Disallow 规则,控制爬虫可访问的路径
  • 支持主流搜索引擎爬虫:Googlebot、Bingbot、Baiduspider 和全部爬虫 (*)
  • AI 爬虫预设:GPTBot、ClaudeBot、Google-Extended、CCBot 等
  • 自定义 User-agent 输入,适配任意爬虫类型
  • 预设模板:标准、阻止 AI 训练、WordPress、电商、严格模式
  • URL 路径测试工具:模拟指定爬虫对路径的访问权限
  • Crawl-delay 指令控制爬取频率,降低服务器负载
  • Sitemap URL 指令帮助爬虫发现网站内容
  • 规则构建时实时预览输出,无需点击生成按钮
  • 复制或下载最终文件:一键复制带视觉反馈,或保存为 .txt 文件直接部署
  • 输出格式符合官方 robots.txt 标准 (RFC 9309) 的语法

使用方法

  1. 1从预设中选择 User-agent(Googlebot、Bingbot 或任意 AI 爬虫),或输入自定义名称。
  2. 2输入要允许或禁止的路径(例如 /admin/、/private/、/public/)。
  3. 3选择 Allow(允许)或 Disallow(禁止):Disallow 阻止爬虫访问该路径,Allow 覆盖更宽泛的 Disallow。
  4. 4点击「添加规则」将规则加入列表。根据需求重复添加多条规则。
  5. 5切换到「模板」标签页快速加载预设配置(阻止 AI 训练、WordPress、电商等)。
  6. 6切换到「URL 测试」标签页模拟指定爬虫对 URL 路径的访问权限。
  7. 7可选设置 Crawl-delay 值(秒),限制爬虫请求频率。
  8. 8添加一个或多个 Sitemap URL,指向您的 XML 站点地图。
  9. 9复制生成的 robots.txt 粘贴到网站根目录,或保存为 .txt 文件。

常见问题

什么是 robots.txt 文件?

robots.txt 是放置在网站根目录的纯文本文件,用于告知搜索引擎爬虫可以或不能访问哪些页面或目录。它遵循 Robots Exclusion Standard,使用 User-agent、Disallow 和 Allow 等指令。爬虫访问您的网站时,会首先检查 robots.txt 以确定可访问的 URL。

路径中可以使用通配符或模式匹配吗?

可以。robots.txt 标准支持通配符:'*' 匹配任意字符序列,'$' 匹配 URL 结尾。例如 'Disallow: /*.pdf$' 阻止所有 PDF 文件,'Disallow: /private/*' 阻止 /private/ 下所有内容。但并非所有搜索引擎都支持所有模式,因此尽量保持简单。

什么是 Crawl-delay?如何使用?

Crawl-delay 告诉搜索引擎爬虫在两次请求之间等待指定的秒数。这有助于降低爬取期间的服务器负载。注意 Googlebot 会忽略 Crawl-delay,请改用 Google Search Console 的抓取速率设置。Bingbot 和 Baiduspider 等其他爬虫可能会遵守它。

应该在 robots.txt 中添加 Sitemap 指令吗?

是的。在 robots.txt 中添加 Sitemap 指令有助于爬虫更快发现您的 XML 站点地图。sitemap URL 应为完整绝对地址(如 https://example.com/sitemap.xml)。您可以为不同站点地图文件(页面、图片、新闻等)添加多个 Sitemap 指令。

如何测试 robots.txt 是否生效?

大多数搜索引擎提供测试工具。Google Search Console 有 robots.txt 测试工具,可查看 Googlebot 如何解读您的文件。您也可以在浏览器中直接访问 https://yourdomain.com/robots.txt 查看。本工具内置 URL 测试器,使用「URL 测试」标签页可模拟任意爬虫对当前规则的访问结果。

robots.txt 能用于安全保护吗?

不能。robots.txt 是对守规矩的爬虫的自愿性指导,并不强制执行访问限制。恶意爬虫或采集器会完全忽略它。切勿将敏感数据藏在 Disallow 指令后面。安全性应使用身份验证和服务端访问控制来实现。

robots.txt 会影响 SEO 排名吗?

间接影响。正确配置的 robots.txt 确保搜索引擎爬取和索引您的重要页面,同时忽略低价值部分(管理后台、搜索结果、标签页面)。误屏蔽重要页面可能导致它们无法出现在搜索结果中。部署前务必仔细检查规则。

如果没有 robots.txt 文件会怎样?

搜索引擎将不受限制地爬取您的整个网站。这对于大多数小型网站来说没有问题,但大型网站应利用 robots.txt 来节约爬取预算,将爬虫从重复、低质或低价值的页面引导到最重要的内容上。

应该阻止哪些 AI 爬虫?

常见的 AI 训练爬虫包括 GPTBot(OpenAI)、ClaudeBot(Anthropic)、Google-Extended(Gemini/Bard)、CCBot(Common Crawl)和 Bytespider(字节跳动)。如果您不希望内容用于 AI 模型训练,请为这些爬虫添加 Disallow 规则。AI 搜索爬虫如 ChatGPT-User 和 PerplexityBot 也可根据需要屏蔽。使用本工具的「阻止 AI 训练」模板可快速配置。

如何使用模板?

切换到「模板」标签页,从预设配置中选择:标准(允许所有)、阻止 AI 训练(禁止 AI 训练爬虫)、WordPress(禁用管理路径)、电商(禁用购物车/结算路径)和严格(仅允许首页和站点地图)。每个模板会自动填充规则、Crawl-delay 和 Sitemap。您可以在「规则」标签页中进一步自定义。

我的robots.txt为什么不生效?

最常见的原因是缓存或语法错误。检查:文件必须放在域名根目录,每条规则独占一行,Disallow路径要精确匹配。Google会缓存robots.txt最多24小时,修改后需要时间生效。可以在Search Console的robots.txt测试工具里验证结果。

robots.txt和meta robots noindex有什么区别?

robots.txt阻止抓取(爬虫不下载页面),meta robots noindex阻止收录(爬虫下载但不存储)。如果用robots.txt屏蔽页面,Google仍可能只索引URL没有内容。要从搜索结果移除页面,应该用noindex。

WordPress 里怎么配置 robots.txt?需要手动建文件吗?

WordPress 会动态生成虚拟 robots.txt,通常根本不需要物理文件。不配置时,WP 默认允许一切,只禁止 /wp-admin/ 和 /wp-includes/。要自定义,用 SEO 插件(Rank Math、Yoast、AIOSEO)或主题 functions.php 里的 robots_txt 过滤器钩子。如果你确实上传了物理 robots.txt,它会完全覆盖虚拟文件,很多人改完插件设置发现不生效,就是这个原因。

我误加了 Disallow: / 把整个网站屏蔽了,怎么恢复?

先改掉文件(删掉该规则或收窄到真实路径)。搜索引擎会频繁重新抓取 robots.txt,Google 至少每 24 小时重查一次,所以恢复通常以小时计而不是以天计。然后用 Search Console 的网址检查工具对你最重要的页面提交抓取请求。全站屏蔽真正的杀伤不是暂停抓取,而是被降索引:页面长期无法被 Googlebot 抓取可能从索引中消失,所以尽快修复,下次部署前先用本工具的 URL 测试验证。