更多: 网站统计
默认行为
新站点默认处于识别并单独计数模式。被识别为机器人的请求进入机器人报表,不计入访客、会话、浏览量和任何真人报表,也不消耗每月事件额度。
模式可以在 网站统计配置机器人 下更改:丢弃直接扔掉机器人数据;不识别把它们混进真人数字。最后一种只为和旧工具对照保留,不建议使用。
五层识别,197+ 条规则
识别在每条数据存储之前运行。足够多的层同时命中时,这条数据被标记为机器人:
- User Agent。 搜索引擎、AI 公司、监控服务和 SEO 工具的已知爬虫标识,是规则库里占比最大的部分。
- 请求头。 真实浏览器一定会带、而它缺失或不一致的请求头。
- 客户端信号。 脚本能否执行、屏幕和时序等无头浏览器容易出错的信号。
- 网络(ASN)。 属于云服务商和已知爬虫运营方的网段。
- 频率。 人做不出来的请求速率,比如同一来源每分钟几百个页面。
规则库集中维护,目前 197+ 条,你不需要更新任何东西。每一行机器人都显示命中了哪些层和一个可信度——已验证、疑似或未知。未知表示我们没能确认运营方,不代表流量是伪造的。
读机器人报表
打开 网站统计机器人,有三个标签:
- AI 台账——按 AI 运营方列出训练抓取和答案引擎抓取的次数、该运营方带回多少真人访客,以及两者的比值。比值高表示读得多、带回的人少。
- AI 可见度——同一份数据反过来看:带回的访问除以抓取次数,看哪些助手真正在引用你。
- 全部机器人——名称、运营方、用途(搜索、AI 训练、AI 答案、监控)、请求数、页面数、最常见状态码、首次与最近出现时间。搜索引擎还有一张小的健康表:成功率、404、5xx。
和 robots.txt、llms.txt 对照
抓取健康视图把你的 robots.txt 和 llms.txt 规则放在爬虫实际抓取记录旁边。被禁止却仍出现在台账里的爬虫值得注意;被允许却停止抓取的搜索引擎也一样。
如果某一行判错了——真人被标成机器人,或者你希望某个机器人按真人处理——在那一行点报告误判。审核后修正会对所有站点生效。
限制
- 只用页面脚本时,你看到的是会执行 JavaScript 的机器人。只抓原始 HTML、不运行脚本的爬虫永远不会出现。要看它们,用服务端 SDK 或日志导入,两者都在开发者文档里。
- 状态码和响应时间来自服务端采集,不是页面脚本。
- 来源报表里的「AI 来源」是从 AI 产品点进来的人;台账数的是读页面的程序。两者相关,但永远不相等。
台账的完整读法见AI 爬虫台账这篇博客。