TapCub 正式上线:统计、分析、客服一个平台免费用

免费工具 AI 爬虫 robots.txt 检查器

粘贴你网站的 robots.txt,逐个看它对各 AI 爬虫的许可。再勾选想拦住的爬虫,复制规则。解析在浏览器里完成——不会向你的网站发请求。

  • 11 个 AI 爬虫 UA
  • 标出起决定作用的规则
  • 本地运行
检查器

粘贴 robots.txt,读结果

打开 https://你的网站/robots.txt,全选复制,粘贴到下面。表格会随输入实时更新。默认文本是一份可替换的示例文件。

已预载示例文件——替换成你自己的。注释和 Sitemap 行会被忽略。

已解析 4 个 User-agent 组。
全部在你的浏览器里计算。这里输入的任何内容都不会上传,TapCub 也不会保存。

允许

0

部分限制

8

禁止

3

未声明

0

逐个爬虫看

爬虫遵守专门写给它的组;没有的话遵守 User-agent: *;两者都没有,就可以抓取全部内容。

根据粘贴的 robots.txt 得出的 AI 爬虫状态
爬虫用途决定性规则状态
GPTBotOpenAI模型训练Disallow: /有专门的 User-agent 组禁止
OAI-SearchBotOpenAIAI 搜索索引Disallow: /admin/ Disallow: /cart沿用 User-agent: *部分限制
ChatGPT-UserOpenAI按用户请求抓取Disallow: /admin/ Disallow: /cart沿用 User-agent: *部分限制
ClaudeBotAnthropic模型训练Disallow: /admin/ Disallow: /cart沿用 User-agent: *部分限制
PerplexityBotPerplexityAI 搜索索引Disallow: /admin/ Disallow: /cart沿用 User-agent: *部分限制
Google-ExtendedGoogle模型训练Disallow: /有专门的 User-agent 组禁止
Applebot-ExtendedApple模型训练Disallow: /admin/ Disallow: /cart沿用 User-agent: *部分限制
Bytespider字节跳动模型训练Disallow: /admin/ Disallow: /cart沿用 User-agent: *部分限制
CCBotCommon Crawl模型训练Disallow: /有专门的 User-agent 组禁止
meta-externalagentMeta模型训练Disallow: /admin/ Disallow: /cart沿用 User-agent: *部分限制
AmazonbotAmazonAI 搜索索引Disallow: /admin/ Disallow: /cart沿用 User-agent: *部分限制

生成规则

勾选想拦住的爬虫,把结果粘到 robots.txt 末尾——每个爬虫一组,其他内容不受影响。

robots.txt
# AI 爬虫 — 由 tapcub.com/tools/ai-crawler 生成

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: CCBot
Disallow: /

robots.txt 是请求,不是锁。知名爬虫会遵守;不遵守的那些,正是机器人报表存在的意义。

它怎么读文件

检查器应用的四条规则

与守规矩的爬虫相同的逻辑,简化到对 AI 爬虫真正重要的几种情况。

  1. 1

    找到属于这个爬虫的组

    一个组以一行或多行 User-agent 开始。爬虫匹配 token 与自己名字相符的组(不区分大小写),并且只有那个组对它生效。

  2. 2

    退回到通配组

    没有自己的组?爬虫就遵守 User-agent: *。表格会标注「沿用 *」,提醒你这个结论是间接的。

  3. 3

    读 Disallow 和 Allow

    Disallow: / 禁止全部;空的 Disallow 允许全部;其他路径算部分限制。Allow: / 会覆盖整站禁止。

  4. 4

    完全没有组就是允许

    一份从未提到某个爬虫、也没有 * 组的 robots.txt 对它没有任何限制。「未声明」实际上等于「允许」。

谁是谁

AI 爬虫做的不是同一件事

全部屏蔽是一种选择,不是默认。训练爬虫复制内容用于训练模型;搜索爬虫为能回链的 AI 回答建索引;助手抓取是因为有人提出了请求。

  • 训练:GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、Bytespider、CCBot、meta-externalagent
  • AI 搜索:OAI-SearchBot、PerplexityBot、Amazonbot——屏蔽它们会让你从 AI 回答里消失
  • 助手抓取:ChatGPT-User——由用户动作触发,更接近浏览器而非爬虫
  • 策略会变,发布前以各厂商文档里的当前 token 名为准

合理的策略长什么样

不想让内容进入下一个模型就屏蔽训练爬虫;想被引用就保留搜索和助手类。片段生成器的默认勾选就是这个分法。

  • GPTBot禁止
  • ClaudeBot禁止
  • OAI-SearchBot允许
  • PerplexityBot允许
  • ChatGPT-User允许
示例数据

机器人报表补上的那一块

robots.txt 表达你的意愿;TapCub 的机器人报表显示它们实际做了什么:每个爬虫每天的请求数、抓了哪些页、被禁止的那个有没有继续来。

AI 爬虫请求 · 近 7 天

GPTBot1,284
ClaudeBot812
PerplexityBot506
Bytespider377
示例数据
示例

默认文件说了什么

示例 robots.txt 点名屏蔽了三个训练爬虫,其他所有爬虫沿用通配规则,而通配规则只限制 /admin/ 和 /cart。

robots.txt
User-agent: *
Disallow: /admin/
Disallow: /cart

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

GPTBot、Google-Extended、CCBot → 禁止

各自有专门的组且写了 Disallow: /。通配组里的任何规则都不再对它们生效。

ClaudeBot、PerplexityBot、Bytespider…… → 部分限制

没有自己的组,所以沿用 User-agent: *,只被挡在 /admin/ 和 /cart 之外,其他全部开放。

如果删掉 * 组 → 未声明

没有通配组时,没被点名的爬虫不受任何限制。大多数网站正处于这种状态。

改动上方检查器里的文本,状态会跟着变化。

常见错误

robots.txt 为什么没按你的意思生效

文件很简单,匹配规则却不直观。

以为 * 规则会叠加到点名组上

不会。有自己组的爬虫完全忽略通配组——包括你写的 Disallow: /admin/。

token 写错

「ChatGPT」「OpenAI」都不是 token。爬虫认的是 GPTBot、OAI-SearchBot 或 ChatGPT-User。拼错了就悄悄匹配不到任何东西。

把 robots.txt 当成强制手段

它只是请求。守规矩的爬虫会遵守,其他的会无视。看机器人报表才知道谁真的照做了。

误伤搜索类爬虫

禁止 OAI-SearchBot 或 PerplexityBot,会让你从本来会链接到你的 AI 回答里消失。逐个爬虫决定。

常见问题

AI 爬虫常见问题

还有其他问题?

直接和 TapCub 团队聊聊——工作日通常几小时内回复。

检查器会去抓我网站的 robots.txt 吗?

不会。它只在你的浏览器里解析你粘贴的文本。不会向你的域名发请求,也不会把内容发给 TapCub。

屏蔽 AI 爬虫会影响搜索排名吗?

屏蔽 GPTBot、Google-Extended 这类训练爬虫不影响常规搜索收录。屏蔽 AI 搜索爬虫只会让你从对应的 AI 回答里消失。

爬虫列表有多新?

覆盖了截至撰写时机器人报表里最常见的 UA。厂商会新增和改名,发布策略前请核对它们的文档。

爬虫无视 robots.txt 怎么办?

那 robots.txt 就帮不上忙了,你需要看到流量本身。TapCub 的机器人报表按爬虫列出请求,便于你决定是否在服务端封禁。见机器人识别。

看清数据,找到增长。

每一次点击,都有数据依据。装好一行代码,1 分钟看到第一批数据。

无需信用卡 · 统计与客服都有免费版 · 统计无 Cookie