TapCub 正式上线:统计、分析、客服一个平台免费用
AI 爬虫

GPTBot、ClaudeBot 与 AI 内容账本:谁拿走了什么

账本把每个 AI 爬虫单独列一行:抓了多少、robots.txt 怎么说、llms.txt 给了什么、带回多少访客。然后允许还是封禁,就是一道算术题。

TCTapCub Team 发布于 2026 年 3 月 26 日 最后更新 2026 年 9 月 4 日 11 分钟阅读 AI 爬虫

一年前 AI 爬虫还只是服务器日志里的新鲜事。今天它们已经是大多数内容型网站请求里能量出来的一块,问题也从「这个用户代理是谁」变成了「要不要放它进来,放进来我们得到什么」。这篇文章讲 TapCub 怎样识别主要的几家助手、爬虫账本怎样把你的 robots.txt 和 llms.txt 与实际发生的抓取对齐,以及怎样读那一列能终结争论的数字:带回的访客。

读完你会知道

  • GPTBot、ClaudeBot、PerplexityBot 与 Googlebot 怎样区分,以及为什么只看用户代理不够
  • 怎样读账本:抓取数、robots.txt、llms.txt、带回访客四列怎么对照
  • 一条站得住的「允许 / 限制 / 封禁」规则,以及误判怎么处理

谁在抓你的页面

这里要紧的自动访客有三类。搜索爬虫(Googlebot、Bingbot)给页面建索引,让人找得到。AI 训练爬虫(GPTBot、ClaudeBot、Google-Extended、Bytespider)收集文本来训练模型。AI 回答爬虫(PerplexityBot、ChatGPT-User、Claude-User)在有人提问的那一刻抓一个页面,好让助手引用它。第三类会把访客带回来,第二类几乎不会。

这个区分重要,因为同一家厂商经常同时跑两三种爬虫,用户代理不同,目的也不同。把「OpenAI」当一个整体封掉,训练爬虫和实时回答的抓取器会一起被封。账本把它们分在不同的行,你才能区别对待。

五层判断,因为用户代理会撒谎

声明的用户代理只是一个主张,不是证据。很多采集器会借一个知名爬虫的名字,希望顺便继承它的权限。TapCub 用另外四层来验证这个主张:请求头(真正的爬虫发的头部集合稀疏且一致)、客户端信号(浏览器会执行统计代码,爬虫不会)、IP 背后的 ASN(GPTBot 的请求应该来自厂商公布的网段)、请求频率(爬虫的突发节奏是人产生不了的)。五层全过才算,否则换一个标签。

在 197 条以上的规则里,每个知名助手有自己的一行,未知的自动流量归为「其他机器人」,表现像浏览器、节奏像人的才算作真人。网站统计概览上的「只看真人」开关,用的就是同一套分类。

robots.txt 说允许,llms.txt 说推荐

有两个文件在和爬虫说话,说的是不同的事。robots.txt 是权限表:哪些用户代理可以抓哪些路径。llms.txt 是邀请函:一份纯文本索引,列出你最希望助手阅读和引用的页面,每行配一句说明。前者靠爬虫守规矩来执行,后者是守规矩的爬虫会参考的建议。

账本从你的网站读取这两个文件,把它们放在实际命中旁边。于是三种行一眼可辨:允许的爬虫抓了你给的页面(正常);不允许的爬虫照抓不误(第一个要点开的行);允许的爬虫一直没来(暂时无需决定)。一份封训练、放回答的最小 robots.txt 长这样:

robots.txt封训练,放回答
# 训练爬虫:不允许
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Bytespider
Disallow: /

# 回答 / 引用爬虫:允许
User-agent: PerplexityBot
User-agent: ChatGPT-User
User-agent: Claude-User
Allow: /

# 搜索引擎:照旧允许
User-agent: Googlebot
User-agent: Bingbot
Allow: /

Sitemap: https://example.com/sitemap.xml

读一个月的账本

下面是一个中型内容站的示例月份。从左往右读:抓了多少次、robots.txt 对这个代理怎么说、抓到的页面是否在 llms.txt 里、同一时期有多少真人访客以这个助手为来源到达。

app.tapcub.com/sites/demo/bots/ledger

机器人抓取 · 30 天

6,254

▲ 31%

被拦截的尝试

998

AI 带回的访客

150

▲ 64%

AI 爬虫账本 · 2026 年 3 月

robots.txt 2 分钟前读取
代理用途抓取robots.txt在 llms.txt 中带回访客
Googlebot搜索3,812允许不适用9,640
GPTBot训练1,204允许62%38
PerplexityBot回答240允许91%112
ClaudeBot训练0(尝试 86)禁止—0
Bytespider训练912禁止—0
其他机器人混合86混合—0

Bytespider 无视 Disallow 抓了 912 页:在边缘节点封,别指望文件。

示例数据
示例账本。高亮行:每带回一个访客所需抓取次数最少。

终结争论的那一列

「带回访客」是唯一能把观点变成数字的一列。示例里 PerplexityBot 的抓取量只有 GPTBot 的五分之一,带回的访客却是三倍,因为它抓页面是为了回答而不是训练。Googlebot 在两列上仍明显排在前面,提醒我们搜索哪儿也没去。ClaudeBot 被禁止,账本显示 86 次尝试、0 次抓取,这正是一个守规矩的爬虫该有的样子。

来自助手的访客会像其他渠道一样出现在来源报表里,你可以建一个「AI 助手带来的访客」分群,看他们落在哪些页面、有没有转化。营销分析把它们归在 AI 助手这个渠道下,不会淹没在「直接访问」里。

允许、限制还是封禁:一条说得过去的规则

账本摆在面前,决定就变成一条简单规则。爬虫带回访客,就允许它,并确保 llms.txt 把它引向你质量更高的页面。爬虫拿得多、什么都不带回,就想清楚出现在模型里值不值这些带宽;很多出版方的答案是不值,于是封训练代理、放回答代理。爬虫无视 robots.txt,就在边缘节点封,而不是在文件里封,因为文件显然不管用。

每月复查一次账本。新代理每个季度都在出现,厂商也会调整哪个代理做什么。AI 爬虫检测能快速判断单条用户代理字符串属于谁,llms.txt 指南讲怎样写那封邀请函。

规则判错的时候

五层很好,但不是完美。剥掉请求头的企业代理、拦截统计代码的隐私浏览器、办公网络里跑自动化测试的 QA 团队,都可能长得像机器人。遇到了,就在账本里把它标为真人。重新分类会应用到历史数据和同一特征的后续命中,改一次就一直生效。

反过来的情况,装成人的采集器,会随时间被请求频率和 ASN 抓出来。怀疑有一个,就打开实时访客视图,筛到那个网络,看节奏。人会停顿,采集器不会。

TC

TapCub Team

设计、开发并支持 TapCub 的这群人。我们写自己网站上量到的东西,也写客户问得最多的问题。

看你自己的爬虫账本

机器人视图把搜索、AI 和其他爬虫与真人分开,并自动读取你的 robots.txt 与 llms.txt。

看清数据,找到增长。

每一次点击,都有数据依据。装好一行代码,1 分钟看到第一批数据。

无需信用卡 · 统计与客服都有免费版 · 统计无 Cookie