llms.txt:提案格式、适用范围与验证方法
llms.txt 是帮助推理时应用发现网站资料的提案格式,不是访问控制标准或引用保证。了解它与 robots.txt、站点地图的差异及采用方法。
llms.txt
llms.txt 是一项提案:网站可在根目录提供 Markdown 文件,帮助推理时使用网站资料的应用了解站点背景,并发现较适合机器读取的页面。它不是正式通用标准,也不是“AI 时代的 robots.txt”。
原始提案建议 /llms.txt 包含简短背景、说明和经过整理的链接;网站还可以提供页面的 Markdown 版本。提案本身没有规定每个模型或服务商必须如何处理该文件。参见 llms.txt 提案原文。
它不能做什么
- 不能授权或禁止爬虫访问;访问控制仍应使用服务商文档、
robots.txt、认证或其他技术措施。 - 不能保证页面被抓取、索引、检索、引用或排名。
- 不能替代 XML 站点地图、规范网址、内链或可访问 HTML。
- 不能证明某个服务商支持该提案;应查阅对方当前文档并做实际验证。
Google 明确表示,其搜索会忽略 llms.txt,因此该文件不会帮助或损害 Google 搜索中的排名与 AI 功能可见性。参见 Google 的生成式 AI 搜索指南。
何时值得采用
如果文档站、API 或研究库已经维护稳定的规范页面和 Markdown 输出,而且某个实际使用的工具明确读取该格式,llms.txt 可以作为低成本导航清单。若站点内容频繁变化、没有维护负责人,或只是为了“抢占 AI 排名”,则可能增加过期链接和重复版本。
实施与验证清单
- 指定负责人、更新触发条件和规范内容来源。
- 只列出稳定、高价值且允许公开访问的网址,并说明每组链接的用途。
- 让 Markdown 版本与网页保持事实和日期一致,避免产生相互竞争的规范信号。
- 返回正确内容类型和状态码,不把敏感资料放入公开文件。
- 检查目标工具是否真的请求该文件,并在服务器日志中保存证据。
- 分别衡量文件抓取、落地页抓取、引用与有效引荐流量,不把它们混为一个“支持”指标。
是否采用应由已确认的消费者与维护成本决定,而不是由文件存在本身决定。