一年前 AI 爬虫还只是服务器日志里的新鲜事。今天它们已经是大多数内容型网站请求里能量出来的一块,问题也从「这个用户代理是谁」变成了「要不要放它进来,放进来我们得到什么」。这篇文章讲 TapCub 怎样识别主要的几家助手、爬虫账本怎样把你的 robots.txt 和 llms.txt 与实际发生的抓取对齐,以及怎样读那一列能终结争论的数字:带回的访客。
读完你会知道
- GPTBot、ClaudeBot、PerplexityBot 与 Googlebot 怎样区分,以及为什么只看用户代理不够
- 怎样读账本:抓取数、robots.txt、llms.txt、带回访客四列怎么对照
- 一条站得住的「允许 / 限制 / 封禁」规则,以及误判怎么处理
谁在抓你的页面
这里要紧的自动访客有三类。搜索爬虫(Googlebot、Bingbot)给页面建索引,让人找得到。AI 训练爬虫(GPTBot、ClaudeBot、Google-Extended、Bytespider)收集文本来训练模型。AI 回答爬虫(PerplexityBot、ChatGPT-User、Claude-User)在有人提问的那一刻抓一个页面,好让助手引用它。第三类会把访客带回来,第二类几乎不会。
这个区分重要,因为同一家厂商经常同时跑两三种爬虫,用户代理不同,目的也不同。把「OpenAI」当一个整体封掉,训练爬虫和实时回答的抓取器会一起被封。账本把它们分在不同的行,你才能区别对待。
五层判断,因为用户代理会撒谎
声明的用户代理只是一个主张,不是证据。很多采集器会借一个知名爬虫的名字,希望顺便继承它的权限。TapCub 用另外四层来验证这个主张:请求头(真正的爬虫发的头部集合稀疏且一致)、客户端信号(浏览器会执行统计代码,爬虫不会)、IP 背后的 ASN(GPTBot 的请求应该来自厂商公布的网段)、请求频率(爬虫的突发节奏是人产生不了的)。五层全过才算,否则换一个标签。
在 197 条以上的规则里,每个知名助手有自己的一行,未知的自动流量归为「其他机器人」,表现像浏览器、节奏像人的才算作真人。网站统计概览上的「只看真人」开关,用的就是同一套分类。
robots.txt 说允许,llms.txt 说推荐
有两个文件在和爬虫说话,说的是不同的事。robots.txt 是权限表:哪些用户代理可以抓哪些路径。llms.txt 是邀请函:一份纯文本索引,列出你最希望助手阅读和引用的页面,每行配一句说明。前者靠爬虫守规矩来执行,后者是守规矩的爬虫会参考的建议。
账本从你的网站读取这两个文件,把它们放在实际命中旁边。于是三种行一眼可辨:允许的爬虫抓了你给的页面(正常);不允许的爬虫照抓不误(第一个要点开的行);允许的爬虫一直没来(暂时无需决定)。一份封训练、放回答的最小 robots.txt 长这样:
# 训练爬虫:不允许
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Bytespider
Disallow: /
# 回答 / 引用爬虫:允许
User-agent: PerplexityBot
User-agent: ChatGPT-User
User-agent: Claude-User
Allow: /
# 搜索引擎:照旧允许
User-agent: Googlebot
User-agent: Bingbot
Allow: /
Sitemap: https://example.com/sitemap.xml读一个月的账本
下面是一个中型内容站的示例月份。从左往右读:抓了多少次、robots.txt 对这个代理怎么说、抓到的页面是否在 llms.txt 里、同一时期有多少真人访客以这个助手为来源到达。
机器人抓取 · 30 天
6,254
▲ 31%
被拦截的尝试
998
AI 带回的访客
150
▲ 64%
AI 爬虫账本 · 2026 年 3 月
robots.txt 2 分钟前读取| 代理 | 用途 | 抓取 | robots.txt | 在 llms.txt 中 | 带回访客 |
|---|---|---|---|---|---|
| Googlebot | 搜索 | 3,812 | 允许 | 不适用 | 9,640 |
| GPTBot | 训练 | 1,204 | 允许 | 62% | 38 |
| PerplexityBot | 回答 | 240 | 允许 | 91% | 112 |
| ClaudeBot | 训练 | 0(尝试 86) | 禁止 | — | 0 |
| Bytespider | 训练 | 912 | 禁止 | — | 0 |
| 其他机器人 | 混合 | 86 | 混合 | — | 0 |
Bytespider 无视 Disallow 抓了 912 页:在边缘节点封,别指望文件。
终结争论的那一列
「带回访客」是唯一能把观点变成数字的一列。示例里 PerplexityBot 的抓取量只有 GPTBot 的五分之一,带回的访客却是三倍,因为它抓页面是为了回答而不是训练。Googlebot 在两列上仍明显排在前面,提醒我们搜索哪儿也没去。ClaudeBot 被禁止,账本显示 86 次尝试、0 次抓取,这正是一个守规矩的爬虫该有的样子。
来自助手的访客会像其他渠道一样出现在来源报表里,你可以建一个「AI 助手带来的访客」分群,看他们落在哪些页面、有没有转化。营销分析把它们归在 AI 助手这个渠道下,不会淹没在「直接访问」里。
允许、限制还是封禁:一条说得过去的规则
账本摆在面前,决定就变成一条简单规则。爬虫带回访客,就允许它,并确保 llms.txt 把它引向你质量更高的页面。爬虫拿得多、什么都不带回,就想清楚出现在模型里值不值这些带宽;很多出版方的答案是不值,于是封训练代理、放回答代理。爬虫无视 robots.txt,就在边缘节点封,而不是在文件里封,因为文件显然不管用。
每月复查一次账本。新代理每个季度都在出现,厂商也会调整哪个代理做什么。AI 爬虫检测能快速判断单条用户代理字符串属于谁,llms.txt 指南讲怎样写那封邀请函。
规则判错的时候
五层很好,但不是完美。剥掉请求头的企业代理、拦截统计代码的隐私浏览器、办公网络里跑自动化测试的 QA 团队,都可能长得像机器人。遇到了,就在账本里把它标为真人。重新分类会应用到历史数据和同一特征的后续命中,改一次就一直生效。
反过来的情况,装成人的采集器,会随时间被请求频率和 ASN 抓出来。怀疑有一个,就打开实时访客视图,筛到那个网络,看节奏。人会停顿,采集器不会。
TapCub Team
设计、开发并支持 TapCub 的这群人。我们写自己网站上量到的东西,也写客户问得最多的问题。