llms.txt 是放在网站根目录的一个纯文本文件,告诉 AI 助手你最希望它们阅读和引用哪些页面。它年轻、非正式、自愿,这意味着两件事:写一份很便宜,也没有人会告诉你它有没有用。这份指南讲文件里该放什么、它和 robots.txt 是什么关系,以及大多数指南跳过的那部分:怎样从你自己的爬虫账本里验证助手有没有抓取它、有没有照着它走。
读完你会知道
- llms.txt 是干什么的,和 robots.txt、站点地图有什么不同
- 一个小时就能改好用的结构与模板
- 怎样从爬虫账本里验证文件和它列出的页面确实被抓取了
llms.txt 是什么,不是什么
想象三个文件。站点地图列出一切,给搜索引擎看,不带观点。robots.txt 设权限:哪些代理可以抓哪些路径。llms.txt 是精选:最能解释你是谁、提供什么的十几个页面,每个配一句说明,写给一个会把你概括给别人的读者。它不授予也不拒绝任何东西。被你在 robots.txt 里封掉的爬虫不会读 llms.txt,被允许的爬虫也可以不理它。
它的价值在于这样一刻:助手被问到你的产品或话题,有几秒钟去抓点什么。一份好的 llms.txt 让正确的页面成为显而易见的选择。
因为格式非正式,各家的支持程度不同,而且变得很快。把这个文件当成低成本的保险:一小时写好,每季度几分钟维护,效果能在你自己的日志里读到,而不是靠信。
里面放什么
短而有结构。一行标题写你的名字,一段描述,然后按用途分组的链接:产品页、文档、定价、政策,再加几篇把常见问题答得好的长文。每个链接配一句简短说明,用大白话说读者会看到什么。用绝对地址。别用营销形容词;助手会引用说明,「领先的平台」出现在别人的回答里很难看。下面是我们发布的那份,略有删节:
# TapCub
> 一段代码搞定无 Cookie 网站统计、数据分析与在线客服。免费版、7 端 SDK、数据按地区存储。
## 产品
- [网站统计](https://tapcub.com/zh/analytics):访客、来源、页面、机器人与性能。
- [数据分析](https://tapcub.com/zh/insights):漏斗、留存、路径、AARRR,覆盖 14 个广告平台的归因。
- [在线客服](https://tapcub.com/zh/chat):主动邀请、AI 回复与双向翻译。
## 定价与政策
- [定价](https://tapcub.com/zh/pricing):Free、Pro、VIP,美元计价。
- [隐私](https://tapcub.com/zh/privacy):采集什么、保留多久。
## 指南
- [为什么 UV 总是对不上](https://tapcub.com/zh/blog/why-uv-never-matches):核对不同工具的访客数。
- [AI 爬虫账本](https://tapcub.com/zh/blog/ai-crawler-ledger):识别 GPTBot、ClaudeBot 等。它和 robots.txt 的关系
两个文件应该一致。llms.txt 里的每个地址都必须对你想让它阅读的代理开放;一个列在 llms.txt、却在 robots.txt 里被封的页面是一个矛盾,爬虫的解法是不抓。反过来,你对训练爬虫封掉的页面(用户内容、搜索结果、登录区)也不该出现在 llms.txt 里。下表总结了每个文件的作用,账本那篇里有一份封训练、放回答的 robots.txt。
| 文件 | 读者 | 说的是 | 靠什么执行 |
|---|---|---|---|
| sitemap.xml | 搜索引擎 | 这里是全部页面和更新时间 | 不执行;只是索引提示 |
| robots.txt | 所有爬虫 | 这些代理可以 / 不可以抓这些路径 | 爬虫守规矩;其余靠边缘规则 |
| llms.txt | AI 助手 | 这些是值得阅读和引用的页面 | 不执行;一封精选的邀请函 |
查一下有没有人读
「llms.txt 有用吗」的诚实答案是「查你的账本」。TapCub 的爬虫账本按代理记录对 /llms.txt 的抓取,并对每个 AI 代理显示它抓取的页面里有多少比例在文件里列出。发布后这个比例上升就是信号。比例持平说明这个代理还没在用它,在你花更多时间之前知道这一点很有用。
下面的示例是发布一个月之后。PerplexityBot 每周抓一次文件,它抓取的页面里 91% 是列出的页面;GPTBot 抓了一次文件,比例停在 62%,大致就是一个读站点地图而不读 llms.txt 的爬虫该有的比例。
/llms.txt 抓取 · 30 天
14
读过它的代理
4
AI 代理命中列表页面比例
74%
▲ 21 pts
/llms.txt · 按代理的抓取与效果
8 月 19 日发布| 代理 | 抓取 llms.txt | 最近抓取 | 页面抓取 | 列表内页面 | 趋势 |
|---|---|---|---|---|---|
| PerplexityBot | 5 | 2 天前 | 240 | 91% | 上升 |
| ChatGPT-User | 4 | 6 天前 | 188 | 83% | 上升 |
| Claude-User | 3 | 9 天前 | 96 | 79% | 上升 |
| GPTBot | 1 | 27 天前 | 1,204 | 62% | 持平 |
| Googlebot | 1 | 12 天前 | 3,812 | — | 不适用 |
保持更新
llms.txt 和任何索引一样会过期。每季度复查一次,或者在发布产品页、下线文档、调整定价时复查。说明要诚实:助手引用了一句关于已下线功能的话,责任在文件。新长文要克制地加,文件应该一屏读完。顶部放一行带日期的注释,好看出上次改动的时间,每次改动一个月后查一次账本。
如果网站有多种语言,每个语言目录发一份,或者一份合并文件按语言分节,说明用它指向的页面的语言来写。助手用提问的语言回答,写错语言的那条说明最可能被丢掉。
常见错误
反复看到四个。列出所有页面(那是站点地图;要精选)。相对地址或会跳转的地址(抓取器最多跟一跳)。把说明写成口号而不是摘要。以及发布之后不查账本,然后断定它没用。一小时写好,一个月后验证,再调整。读日志的时候,AI 爬虫检测能告诉你一条用户代理字符串属于哪个代理。
TapCub Team
设计、开发并支持 TapCub 的这群人。我们写自己网站上量到的东西,也写客户问得最多的问题。