免费工具 AI 爬虫 robots.txt 检查器
粘贴你网站的 robots.txt,逐个看它对各 AI 爬虫的许可。再勾选想拦住的爬虫,复制规则。解析在浏览器里完成——不会向你的网站发请求。
- 11 个 AI 爬虫 UA
- 标出起决定作用的规则
- 本地运行
粘贴 robots.txt,读结果
打开 https://你的网站/robots.txt,全选复制,粘贴到下面。表格会随输入实时更新。默认文本是一份可替换的示例文件。
已预载示例文件——替换成你自己的。注释和 Sitemap 行会被忽略。
允许
0
部分限制
8
禁止
3
未声明
0
逐个爬虫看
爬虫遵守专门写给它的组;没有的话遵守 User-agent: *;两者都没有,就可以抓取全部内容。
| 爬虫 | 用途 | 决定性规则 | 状态 |
|---|---|---|---|
| GPTBotOpenAI | 模型训练 | Disallow: /有专门的 User-agent 组 | 禁止 |
| OAI-SearchBotOpenAI | AI 搜索索引 | Disallow: /admin/ Disallow: /cart沿用 User-agent: * | 部分限制 |
| ChatGPT-UserOpenAI | 按用户请求抓取 | Disallow: /admin/ Disallow: /cart沿用 User-agent: * | 部分限制 |
| ClaudeBotAnthropic | 模型训练 | Disallow: /admin/ Disallow: /cart沿用 User-agent: * | 部分限制 |
| PerplexityBotPerplexity | AI 搜索索引 | Disallow: /admin/ Disallow: /cart沿用 User-agent: * | 部分限制 |
| Google-ExtendedGoogle | 模型训练 | Disallow: /有专门的 User-agent 组 | 禁止 |
| Applebot-ExtendedApple | 模型训练 | Disallow: /admin/ Disallow: /cart沿用 User-agent: * | 部分限制 |
| Bytespider字节跳动 | 模型训练 | Disallow: /admin/ Disallow: /cart沿用 User-agent: * | 部分限制 |
| CCBotCommon Crawl | 模型训练 | Disallow: /有专门的 User-agent 组 | 禁止 |
| meta-externalagentMeta | 模型训练 | Disallow: /admin/ Disallow: /cart沿用 User-agent: * | 部分限制 |
| AmazonbotAmazon | AI 搜索索引 | Disallow: /admin/ Disallow: /cart沿用 User-agent: * | 部分限制 |
生成规则
勾选想拦住的爬虫,把结果粘到 robots.txt 末尾——每个爬虫一组,其他内容不受影响。
# AI 爬虫 — 由 tapcub.com/tools/ai-crawler 生成
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: CCBot
Disallow: /robots.txt 是请求,不是锁。知名爬虫会遵守;不遵守的那些,正是机器人报表存在的意义。
检查器应用的四条规则
与守规矩的爬虫相同的逻辑,简化到对 AI 爬虫真正重要的几种情况。
-
1
找到属于这个爬虫的组
一个组以一行或多行 User-agent 开始。爬虫匹配 token 与自己名字相符的组(不区分大小写),并且只有那个组对它生效。
-
2
退回到通配组
没有自己的组?爬虫就遵守 User-agent: *。表格会标注「沿用 *」,提醒你这个结论是间接的。
-
3
读 Disallow 和 Allow
Disallow: / 禁止全部;空的 Disallow 允许全部;其他路径算部分限制。Allow: / 会覆盖整站禁止。
-
4
完全没有组就是允许
一份从未提到某个爬虫、也没有 * 组的 robots.txt 对它没有任何限制。「未声明」实际上等于「允许」。
AI 爬虫做的不是同一件事
全部屏蔽是一种选择,不是默认。训练爬虫复制内容用于训练模型;搜索爬虫为能回链的 AI 回答建索引;助手抓取是因为有人提出了请求。
- 训练:GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、Bytespider、CCBot、meta-externalagent
- AI 搜索:OAI-SearchBot、PerplexityBot、Amazonbot——屏蔽它们会让你从 AI 回答里消失
- 助手抓取:ChatGPT-User——由用户动作触发,更接近浏览器而非爬虫
- 策略会变,发布前以各厂商文档里的当前 token 名为准
合理的策略长什么样
不想让内容进入下一个模型就屏蔽训练爬虫;想被引用就保留搜索和助手类。片段生成器的默认勾选就是这个分法。
- GPTBot禁止
- ClaudeBot禁止
- OAI-SearchBot允许
- PerplexityBot允许
- ChatGPT-User允许
机器人报表补上的那一块
robots.txt 表达你的意愿;TapCub 的机器人报表显示它们实际做了什么:每个爬虫每天的请求数、抓了哪些页、被禁止的那个有没有继续来。
AI 爬虫请求 · 近 7 天
默认文件说了什么
示例 robots.txt 点名屏蔽了三个训练爬虫,其他所有爬虫沿用通配规则,而通配规则只限制 /admin/ 和 /cart。
User-agent: *
Disallow: /admin/
Disallow: /cart
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /GPTBot、Google-Extended、CCBot → 禁止
各自有专门的组且写了 Disallow: /。通配组里的任何规则都不再对它们生效。
ClaudeBot、PerplexityBot、Bytespider…… → 部分限制
没有自己的组,所以沿用 User-agent: *,只被挡在 /admin/ 和 /cart 之外,其他全部开放。
如果删掉 * 组 → 未声明
没有通配组时,没被点名的爬虫不受任何限制。大多数网站正处于这种状态。
改动上方检查器里的文本,状态会跟着变化。
robots.txt 为什么没按你的意思生效
文件很简单,匹配规则却不直观。
以为 * 规则会叠加到点名组上
不会。有自己组的爬虫完全忽略通配组——包括你写的 Disallow: /admin/。
token 写错
「ChatGPT」「OpenAI」都不是 token。爬虫认的是 GPTBot、OAI-SearchBot 或 ChatGPT-User。拼错了就悄悄匹配不到任何东西。
把 robots.txt 当成强制手段
它只是请求。守规矩的爬虫会遵守,其他的会无视。看机器人报表才知道谁真的照做了。
误伤搜索类爬虫
禁止 OAI-SearchBot 或 PerplexityBot,会让你从本来会链接到你的 AI 回答里消失。逐个爬虫决定。
检查器会去抓我网站的 robots.txt 吗?
不会。它只在你的浏览器里解析你粘贴的文本。不会向你的域名发请求,也不会把内容发给 TapCub。
屏蔽 AI 爬虫会影响搜索排名吗?
屏蔽 GPTBot、Google-Extended 这类训练爬虫不影响常规搜索收录。屏蔽 AI 搜索爬虫只会让你从对应的 AI 回答里消失。
爬虫列表有多新?
覆盖了截至撰写时机器人报表里最常见的 UA。厂商会新增和改名,发布策略前请核对它们的文档。
爬虫无视 robots.txt 怎么办?
那 robots.txt 就帮不上忙了,你需要看到流量本身。TapCub 的机器人报表按爬虫列出请求,便于你决定是否在服务端封禁。见机器人识别。