TapCub 正式上线:统计、分析、客服一个平台免费用
帮助中心

机器人与 AI 爬虫

已识别的机器人默认单独计数。这篇讲识别怎么做、真人与全部流量怎么切换,以及 AI 台账怎么读。

网站统计6 分钟阅读最后更新 2026 年 9 月 25 日TapCub 团队

还有其他问题?

没找到答案?每条消息都有真人阅读,工作日通常几小时内回复。

在线咨询

默认行为

新站点默认处于识别并单独计数模式。被识别为机器人的请求进入机器人报表,不计入访客、会话、浏览量和任何真人报表,也不消耗每月事件额度。

模式可以在 网站统计配置机器人 下更改:丢弃直接扔掉机器人数据;不识别把它们混进真人数字。最后一种只为和旧工具对照保留,不建议使用。

五层识别,197+ 条规则

识别在每条数据存储之前运行。足够多的层同时命中时,这条数据被标记为机器人:

  1. User Agent。 搜索引擎、AI 公司、监控服务和 SEO 工具的已知爬虫标识,是规则库里占比最大的部分。
  2. 请求头。 真实浏览器一定会带、而它缺失或不一致的请求头。
  3. 客户端信号。 脚本能否执行、屏幕和时序等无头浏览器容易出错的信号。
  4. 网络(ASN)。 属于云服务商和已知爬虫运营方的网段。
  5. 频率。 人做不出来的请求速率,比如同一来源每分钟几百个页面。

规则库集中维护,目前 197+ 条,你不需要更新任何东西。每一行机器人都显示命中了哪些层和一个可信度——已验证、疑似或未知。未知表示我们没能确认运营方,不代表流量是伪造的。

读机器人报表

打开 网站统计机器人,有三个标签:

  • AI 台账——按 AI 运营方列出训练抓取和答案引擎抓取的次数、该运营方带回多少真人访客,以及两者的比值。比值高表示读得多、带回的人少。
  • AI 可见度——同一份数据反过来看:带回的访问除以抓取次数,看哪些助手真正在引用你。
  • 全部机器人——名称、运营方、用途(搜索、AI 训练、AI 答案、监控)、请求数、页面数、最常见状态码、首次与最近出现时间。搜索引擎还有一张小的健康表:成功率、404、5xx。
每张统计报表顶部的开关可以在真人和全部流量之间切换。真人是默认值,也是该对外汇报的数字;全部流量用来排查抓取量。

和 robots.txt、llms.txt 对照

抓取健康视图把你的 robots.txt 和 llms.txt 规则放在爬虫实际抓取记录旁边。被禁止却仍出现在台账里的爬虫值得注意;被允许却停止抓取的搜索引擎也一样。

如果某一行判错了——真人被标成机器人,或者你希望某个机器人按真人处理——在那一行点报告误判。审核后修正会对所有站点生效。

限制

  • 只用页面脚本时,你看到的是会执行 JavaScript 的机器人。只抓原始 HTML、不运行脚本的爬虫永远不会出现。要看它们,用服务端 SDK 或日志导入,两者都在开发者文档里。
  • 状态码和响应时间来自服务端采集,不是页面脚本。
  • 来源报表里的「AI 来源」是从 AI 产品点进来的人;台账数的是读页面的程序。两者相关,但永远不相等。

台账的完整读法见AI 爬虫台账这篇博客。

这篇文章有帮助吗?

你的反馈决定我们下一步扩写哪些文章。

感谢反馈。如果还有没说清楚的地方, 告诉我们你在找什么。

看清数据,找到增长。

每一次点击,都有数据依据。装好一行代码,1 分钟看到第一批数据。

无需信用卡 · 统计与客服都有免费版 · 统计无 Cookie