TapCub 正式上线:统计、分析、客服一个平台免费用
AI 爬虫

llms.txt:该写什么,以及怎么知道有没有人在读

llms.txt 是邀请函,不是规则。一份简短指南,教你写一份助手真的会用的文件,以及告诉你它们到底用没用的那个账本检查。

TCTapCub Team 发布于 2026 年 9 月 17 日 7 分钟阅读 AI 爬虫

用你自己的数据试一下

这篇文章里出现的报表免费版全都有。一段代码、无 Cookie、最多 10 个站点。

免费开始

llms.txt 是放在网站根目录的一个纯文本文件,告诉 AI 助手你最希望它们阅读和引用哪些页面。它年轻、非正式、自愿,这意味着两件事:写一份很便宜,也没有人会告诉你它有没有用。这份指南讲文件里该放什么、它和 robots.txt 是什么关系,以及大多数指南跳过的那部分:怎样从你自己的爬虫账本里验证助手有没有抓取它、有没有照着它走。

读完你会知道

  • llms.txt 是干什么的,和 robots.txt、站点地图有什么不同
  • 一个小时就能改好用的结构与模板
  • 怎样从爬虫账本里验证文件和它列出的页面确实被抓取了

llms.txt 是什么,不是什么

想象三个文件。站点地图列出一切,给搜索引擎看,不带观点。robots.txt 设权限:哪些代理可以抓哪些路径。llms.txt 是精选:最能解释你是谁、提供什么的十几个页面,每个配一句说明,写给一个会把你概括给别人的读者。它不授予也不拒绝任何东西。被你在 robots.txt 里封掉的爬虫不会读 llms.txt,被允许的爬虫也可以不理它。

它的价值在于这样一刻:助手被问到你的产品或话题,有几秒钟去抓点什么。一份好的 llms.txt 让正确的页面成为显而易见的选择。

因为格式非正式,各家的支持程度不同,而且变得很快。把这个文件当成低成本的保险:一小时写好,每季度几分钟维护,效果能在你自己的日志里读到,而不是靠信。

里面放什么

短而有结构。一行标题写你的名字,一段描述,然后按用途分组的链接:产品页、文档、定价、政策,再加几篇把常见问题答得好的长文。每个链接配一句简短说明,用大白话说读者会看到什么。用绝对地址。别用营销形容词;助手会引用说明,「领先的平台」出现在别人的回答里很难看。下面是我们发布的那份,略有删节:

llms.txt删节示例
# TapCub

> 一段代码搞定无 Cookie 网站统计、数据分析与在线客服。免费版、7 端 SDK、数据按地区存储。

## 产品
- [网站统计](https://tapcub.com/zh/analytics):访客、来源、页面、机器人与性能。
- [数据分析](https://tapcub.com/zh/insights):漏斗、留存、路径、AARRR,覆盖 14 个广告平台的归因。
- [在线客服](https://tapcub.com/zh/chat):主动邀请、AI 回复与双向翻译。

## 定价与政策
- [定价](https://tapcub.com/zh/pricing):Free、Pro、VIP,美元计价。
- [隐私](https://tapcub.com/zh/privacy):采集什么、保留多久。

## 指南
- [为什么 UV 总是对不上](https://tapcub.com/zh/blog/why-uv-never-matches):核对不同工具的访客数。
- [AI 爬虫账本](https://tapcub.com/zh/blog/ai-crawler-ledger):识别 GPTBot、ClaudeBot 等。

它和 robots.txt 的关系

两个文件应该一致。llms.txt 里的每个地址都必须对你想让它阅读的代理开放;一个列在 llms.txt、却在 robots.txt 里被封的页面是一个矛盾,爬虫的解法是不抓。反过来,你对训练爬虫封掉的页面(用户内容、搜索结果、登录区)也不该出现在 llms.txt 里。下表总结了每个文件的作用,账本那篇里有一份封训练、放回答的 robots.txt。

文件读者说的是靠什么执行
sitemap.xml搜索引擎这里是全部页面和更新时间不执行;只是索引提示
robots.txt所有爬虫这些代理可以 / 不可以抓这些路径爬虫守规矩;其余靠边缘规则
llms.txtAI 助手这些是值得阅读和引用的页面不执行;一封精选的邀请函

查一下有没有人读

「llms.txt 有用吗」的诚实答案是「查你的账本」。TapCub 的爬虫账本按代理记录对 /llms.txt 的抓取,并对每个 AI 代理显示它抓取的页面里有多少比例在文件里列出。发布后这个比例上升就是信号。比例持平说明这个代理还没在用它,在你花更多时间之前知道这一点很有用。

下面的示例是发布一个月之后。PerplexityBot 每周抓一次文件,它抓取的页面里 91% 是列出的页面;GPTBot 抓了一次文件,比例停在 62%,大致就是一个读站点地图而不读 llms.txt 的爬虫该有的比例。

app.tapcub.com/sites/demo/bots/llms-txt

/llms.txt 抓取 · 30 天

14

读过它的代理

4

AI 代理命中列表页面比例

74%

▲ 21 pts

/llms.txt · 按代理的抓取与效果

8 月 19 日发布
代理抓取 llms.txt最近抓取页面抓取列表内页面趋势
PerplexityBot52 天前24091%上升
ChatGPT-User46 天前18883%上升
Claude-User39 天前9679%上升
GPTBot127 天前1,20462%持平
Googlebot112 天前3,812—不适用
示例数据
发布一个月后的示例视图。回答型代理每周读文件,训练爬虫只读了一次。

保持更新

llms.txt 和任何索引一样会过期。每季度复查一次,或者在发布产品页、下线文档、调整定价时复查。说明要诚实:助手引用了一句关于已下线功能的话,责任在文件。新长文要克制地加,文件应该一屏读完。顶部放一行带日期的注释,好看出上次改动的时间,每次改动一个月后查一次账本。

如果网站有多种语言,每个语言目录发一份,或者一份合并文件按语言分节,说明用它指向的页面的语言来写。助手用提问的语言回答,写错语言的那条说明最可能被丢掉。

常见错误

反复看到四个。列出所有页面(那是站点地图;要精选)。相对地址或会跳转的地址(抓取器最多跟一跳)。把说明写成口号而不是摘要。以及发布之后不查账本,然后断定它没用。一小时写好,一个月后验证,再调整。读日志的时候,AI 爬虫检测能告诉你一条用户代理字符串属于哪个代理。

TC

TapCub Team

设计、开发并支持 TapCub 的这群人。我们写自己网站上量到的东西,也写客户问得最多的问题。

看看助手有没有读你的 llms.txt

机器人视图记录文件的每次抓取,并按代理显示它读到的页面里有多少在你的列表上。

看清数据,找到增长。

每一次点击,都有数据依据。装好一行代码,1 分钟看到第一批数据。

无需信用卡 · 统计与客服都有免费版 · 统计无 Cookie