如何正确实施 llms.txt
通过实用模板、CMS 工作流程、质量检查和常见问题修复方法,掌握 llms.txt 文件的规划、编写、发布、验证与维护。
快速解答
实施 llms.txt 时,应在 /llms.txt 发布一份简洁的 Markdown 文件,写明网站名称与用途,并链接到经过精选、实用且采用规范网址的页面。robots.txt 和 sitemap.xml 应保持独立,不要将整页内容复制到 llms.txt 中。发布前验证每个 URL,并在重要内容迁移时更新链接列表。
要点总结
- llms.txt 是一份经过精选的内容发现文档,不是访问控制文件,也不能替代 sitemap.xml。
- 一份精简、信息价值高的规范 URL 列表,比罗列所有页面更有用。
- 每个链接指向的页面仍需允许抓取、提供稳定的 HTML、使用规范 URL,并直接回答相关问题。
- 发布前应检查状态码、重定向、重复链接和内容类型。
- 将 llms.txt 视为需要持续维护的文档,每次网站结构变化时都要复查。
llms.txt 应包含哪些内容?
这份文件应帮助 AI 系统快速了解:网站是什么、哪些页面具有权威性,以及在哪里可以找到核心文档或政策。应收录能够长期使用的页面,用于介绍组织、产品、文档、价格、重要概念和更新日志。应排除内容单薄的归档页、带跟踪参数的 URL、重复页面、筛选结果页,以及你不希望被摘要引用的页面。
| 建议收录 | 通常应排除 | 原因 |
|---|---|---|
| 采用规范 URL 的产品页和文档页 | 搜索与筛选结果页 | 稳定的页面能提供可复用的上下文 |
| 术语表和高质量指南 | 标签归档页和分页页面 | 定义和操作步骤便于提取 |
| 当前价格、政策和更新日志 | 已过期的营销活动 | 时效性信息需要有权威 URL 作为依据 |
| 少量具有代表性的示例 | 所有内容高度相似的地区页面 | 精选内容有助于减少歧义 |
实用的 llms.txt 格式是什么样的?
使用普通 Markdown 即可:一个 H1 标题、一段简短摘要、可选的补充说明,再加上按用途分组的描述性链接。链接文字即使脱离页面上下文,也应含义清晰。这项提案的格式约定旨在兼顾人和机器的可读性,因此不要加入脚本、隐藏指令或自行编造的排名命令。
# Example Company
> Official documentation and product information for Example Company.
## Core
- [Product overview](https://example.com/product): Capabilities and supported use cases.
- [Documentation](https://example.com/docs): Setup and API reference.
- [Pricing](https://example.com/pricing): Current plans and limits.
## Learn
- [Glossary](https://example.com/glossary): Definitions of domain terms.如何发布并验证 llms.txt 文件?
- 盘点能够提供最权威答案的页面。
- 剔除存在重定向、内容重复、非公开、过时或价值较低的 URL。
- 按访问者的使用目的对剩余链接分组,并为每个链接撰写具体描述。
- 在根路径 /llms.txt 上发布纯文本形式的 Markdown 响应,确保路径完全一致。
- 请求公开 URL,逐一访问其中的链接,确认每个目标页面均使用规范 URL 且可被索引。
- 将负责人和定期复查安排纳入导航与站点地图的更新流程。
不同技术栈应如何部署 llms.txt?
| 技术栈 | 推荐方式 | 验证方法 |
|---|---|---|
| 静态网站 | 提交 public/llms.txt 文件 | 部署后打开根路径下的文件 URL |
| CMS | 使用根级路由、插件或边缘规则 | 确认响应未被主题的 HTML 包裹 |
| 无头应用 | 通过公开源站提供纯文本路由 | 在生产环境测试,而不只是在预览环境测试 |
| 大型文档网站 | 根据经过审核的规范 URL 清单生成文件 | 比对变更,并在 CI 中阻止包含失效链接的版本通过 |
哪些 llms.txt 错误会降低其实用性?
- 罗列数百个 URL,却没有描述或层级结构。
- 链接指向重定向地址、预发布环境主机、带跟踪参数的 URL,或非规范的重复页面。
- 将 robots 指令复制到 llms.txt,并误以为它们能控制访问权限。
- 使用营销宣传语,而不是客观描述各页面的实际内容。
- 只生成一次文件,之后不再维护,导致已删除或过时的页面仍留在列表中。
- 在该路径返回 HTML 错误页、身份验证页面,或使用错误的内容类型。
如何衡量 llms.txt 是否有效?
应衡量整个使用链路,而不是寄望于所谓的排名提升。首先确认文件是否被抓取,再检查其中链接的页面是否获得抓取访问、是否出现在检索引用中,以及摘要是否准确。使用一组固定提示词对比发布前后的结果,同时记录其他改动,避免将内容或结构化数据改进带来的效果误归因于 llms.txt。
分步指南
- 1选择采用规范 URL 的页面
精选一组具有长期价值的页面,确保其中包含 AI 助手应参考的事实和操作步骤。
- 2编写描述性 Markdown 链接
按用途对链接分组,并用一句话说明每个目标页面的独特价值。
- 3发布到根路径
在 /llms.txt 公开提供纯文本或 Markdown 文件,无需身份验证即可访问。
- 4验证每个目标页面
逐一检查每个 URL 的状态码、重定向目标、规范 URL 声明、语言以及页面上可见的答案。
- 5制定定期复查安排
当关键页面、产品、价格、政策或文档发生变化时,及时更新文件。
常见问题
- llms.txt 是正式的 Web 标准吗?
- llms.txt 是一项社区提案,而非普遍强制执行的 Web 标准。可以将其作为低风险的内容发现辅助工具发布,但仍需确保 robots.txt、站点地图、规范 URL 声明和可访问的 HTML 等成熟机制配置正确。
- llms.txt 能替代 robots.txt 吗?
- 不能。robots.txt 用于告知抓取权限,llms.txt 则用于精选实用页面并提供上下文。llms.txt 中的链接无法绕过 robots 规则、防火墙拦截、登录要求,也无法让原本不可访问的页面变得可访问。
- llms.txt 应包含多少个 URL?
- 没有统一的数量要求。应以尽可能少的页面准确呈现网站的核心内容。一份重点明确、包含描述性规范链接的文件,比完整导出的 URL 清单更容易维护和理解。
- llms.txt 应收录每篇博客文章吗?
- 通常不需要。应收录核心文章、具有长期价值的研究和重要指南。让 sitemap.xml 负责广泛的内容发现,再用 llms.txt 指向最能说明网站内容与定位的页面。
- 如何测试 llms.txt?
- 从生产环境请求 /llms.txt,确认成功返回纯文本响应,再逐一检查链接 URL 的状态码、最终目标地址、规范 URL 声明、语言,以及是否提供有用的服务端渲染内容。
Sources
- [1]llms.txt 提案
- [2]Google 站点地图指南
- [3]Google robots.txt 指南