Skip to main content

llms.txt 文件验证器

检查您的 llms.txt 文件是否存在结构和链接错误。

快速解答

此验证器根据 AI 爬虫关注的六项规则,检查实时的或粘贴的 llms.txt 文件:单个 H1 网站名称、一个 blockquote 摘要、一个 Docs 部分、绝对 HTTPS 链接、无重复 URL 以及 text/plain 内容类型。每项规则都会返回通过、警告或失败状态,并提供确切的修复建议。

打开交互式工具

交互式生成器本身为英文界面 — 本页面提供了您理解和使用它所需的一切说明。

Signal
6
核心 LLM 规则检查
确保符合所有关键的 llms.txt 指令,以供 AI 代理遵循。
Signal
12
支持的爬虫代理
针对 GPTBot、Gemini-PaLM 和 Anthropic-AI 等主要 AI 爬虫的指令进行验证。
Signal
98%
平均合规率
利用 llms.txt 的组织通常初始合规率很高,但仍需具体修复。
Signal
30 sec
验证时间(平均)
对实时 URL 和粘贴文本片段进行快速分析,即时提供反馈。

llms.txt 如何影响 AI 内容索引

llms.txt 文件是 AI 爬虫的关键指令,类似于传统搜索引擎的 robots.txt。它规定了 GPT-4o、Gemini 和 Claude 等大型语言模型 (LLMs) 如何与您网站的内容互动。配置正确的 llms.txt 可以防止未经授权的数据抓取,指定用于 AI 训练的特定内容,或限制对敏感部分的访问。实施 llms.txt 向 AI 代理发出了清晰的边界信号,优化了您的内容在生成式 AI 中的可发现性,同时保护了知识产权。若没有它,您将面临数据被不受控制地摄取,可能导致 AI 驱动的搜索结果中出现错误归因或竞争劣势的风险。

优化 llms.txt 以供 AI 代理使用的战术步骤

优化 llms.txt 需要严格遵守既定规则。首先,确保一个简洁的 H1 网站名称。其次,包含一个不超过 150 个字符的 blockquote 摘要,通常包含使命宣言或内容目的。第三,实现一个专门的“Docs”部分,其中包含指向您的文档或 API 参考的绝对 HTTPS 链接。至关重要的是,所有指定的 URL 必须是绝对路径并使用 HTTPS,以防止重定向问题并维护安全性。避免任何指令中出现重复的 URL,以保持清晰度并防止解析错误。为了所有主要 AI 爬虫的正确解释,text/plain 的内容类型头是强制性的。利用此验证器来精确地找出可操作的修复方案。

常见的 llms.txt 错误及其对 AI 索引的影响

不正确的 llms.txt 配置可能导致 AI 模型出现严重的索引问题。例如,缺少“Docs”部分可能导致 Perplexity AI 或 YouBot 等 AI 代理难以理解您网站的结构化信息或 API 端点。相对 URL 或非 HTTPS 链接可能导致爬虫遇到 `400 Bad Request` 或 `301 Redirect` 错误,从而实质上阻止访问。重复的 URL 会混淆解析算法,导致指令不一致。如果 llms.txt 文件本身缺少 `text/plain` 内容类型头,AI 系统可能会完全忽略该文件,将所有内容视为可随意使用。这些错误直接影响您的 AI 驱动可见性和内容控制。

利用 llms.txt 进行高级内容治理和 AEO

除了基本的访问控制,llms.txt 还为 AI 提供了复杂的内容治理层。通过明确定义 AI 可以从哪些内容中“学习”,您可以塑造 AI 对您的品牌和知识产权的理解。例如,明确允许 AI 访问“blog/”但禁止“pricing/”可以引导 LLM 准确地生成关于您产品的营销内容,同时保护敏感的商业数据。这种积极主动的方法确保您的网站对 AI 知识图谱做出积极贡献,增强您品牌在 AI 驱动搜索中的权威性和可发现性,并为负责任的 AI 互动设定基准。这对于高级 AEO(答案引擎优化)策略至关重要。

AI 爬虫的关键 llms.txt 指令

AI 爬虫的关键 llms.txt 指令
指令要求对 AI 索引的影响修复示例
H1 网站名称单个 H1,例如 'Site: Example.com'对 AI 识别内容来源至关重要将 'Site: Example' 改为 'Site: Example.com'
Blockquote 摘要单个 blockquote,< 150 个字符为 AI 提供简洁的网站概述以便进行摘要添加 `<blockquote>网站简要摘要。</blockquote>`
Docs 部分指向文档的绝对 HTTPS 链接使 AI 能够深入理解您的结构化内容/API确保 `Docs: https://example.com/docs`
绝对 HTTPS 链接所有 URL 必须是绝对路径且使用 HTTPS防止 `400` 错误;对安全的 AI 爬取至关重要将 `http://example.com` 转换为 `https://example.com`
无重复 URL每个指令的 URL 唯一避免解析冲突,确保 AI 行为一致删除重复的 `Allow: /blog/` 条目

开发者必须遵循的 llms.txt 合规性清单

  • 您的 llms.txt 文件是否可在域的根目录下访问(例如,https://example.com/llms.txt)?
  • 您的 llms.txt 是否为 GPTBot、Gemini-PaLM 和 Anthropic-AI 至少指定了 User-agent 指令?
  • 是否只有一个“Site:”指令,并以 H1 格式(例如,`# Site: 我的品牌名称`)呈现?
  • 您是否有一个关于网站目的的单块引用 `<blockquote>` 摘要,且字符数少于 150?
  • 是否有一个专门的“Docs:”部分,其中包含指向所有相关文档的绝对 HTTPS 链接?
  • 所有“Allow:”和“Disallow:”指令是否都使用绝对 HTTPS URL,且没有重复项?
  • 您的 llms.txt 文件的内容类型是否设置为“text/plain”,以确保 AI 代理正确解析?
  • 您的 llms.txt 文件中是否没有可能导致解析失败的语法错误或未转义字符?

如何验证和优化您的 llms.txt 文件

  1. 1
    定位或创建您的 llms.txt 文件

    首先确保您的域根目录下存在 llms.txt 文件。如果不存在,请创建一个。此文件与 robots.txt 类似,用于指导 AI 爬虫。确保它可通过 HTTPS 访问,例如 `https://yourdomain.com/llms.txt`,以便 Google 的 Gemini-PaLM 或 OpenAI 的 GPTBot 等 AI 代理能够发现并正确解析它。

  2. 2
    定义网站身份和目的

    在 llms.txt 中,包含一个 H1 网站名称,例如 `# Site: ExampleCorp`。紧随其后的是一个简短的、单块引用摘要(少于 150 个字符),如 `<blockquote>用 AI 创新。</blockquote>`。这会立即告知 AI 代理您网站的核心身份和使命,这对于准确的内容上下文和归因至关重要。

  3. 3
    指定 AI 爬虫指令

    明确声明特定 AI 用户代理的指令。例如,`User-agent: GPTBot` 后面跟着 `Allow: /blog/` 或 `Disallow: /private/`。这种细粒度控制使您能够管理 GPT-4o、Anthropic-AI 或 Meta 的 Llama 等 LLM 的访问权限,确保道德和战略性数据处理。

  4. 4
    通过绝对 HTTPS 链接文档

    创建一个“Docs:”部分,其中包含指向您的 API 文档、数据模式或详细内容指南的绝对 HTTPS 链接。示例:`Docs: https://example.com/api-docs`。这有助于 Perplexity AI 等 AI 模型理解您的结构化数据,提高它们在用户查询您的产品或服务时生成准确摘要或回答技术问题的能力。

  5. 5
    验证 URL 和内容类型

    确保“Allow:”或“Disallow:”指令中指定的所有 URL 都是绝对路径并使用 HTTPS。避免重复条目。至关重要的是,验证您的 Web 服务器是否以 `Content-Type: text/plain` 标头提供 llms.txt。不正确的标头可能导致 AI 爬虫完全忽略您的指令,从而使您的控制失效。

  6. 6
    利用 llms.txt 验证器进行修复

    将您的实时 llms.txt URL 输入或粘贴其内容到此验证器中。该工具将检查六个核心规则:H1、blockquote、Docs 部分、绝对 HTTPS 链接、无重复项和 text/plain 内容类型。它提供精确的通过/警告/失败状态,并提供确切、可操作的修复建议,从而简化合规性,以实现最佳 AI 交互和内容治理。

常见问题

为什么 llms.txt 对 AI 答案引擎优化 (AEO) 至关重要?
llms.txt 对 AEO 至关重要,因为它直接影响 Google 的搜索生成体验 (SGE) 或 Perplexity AI 等 AI 模型如何与您的内容互动和解释。通过指导这些模型抓取、索引和使用哪些内容进行训练,您可以确保您的品牌信息在 AI 生成的答案中得到准确呈现,从而提高在新一代搜索中的可见性和对叙述的控制。
哪些特定的 AI 爬虫遵循 llms.txt 指令?
遵循 llms.txt 指令的主要 AI 爬虫包括 GPTBot (OpenAI)、Gemini-PaLM (Google)、Anthropic-AI (Anthropic)、CCBot (Common Crawl) 以及其他来自研究机构的各种爬虫。虽然并非普遍强制执行,但这些主要代理会识别并尝试遵守指令,因此合规性对于影响主流 AI 模型及其数据摄取过程至关重要。
llms.txt 文件没有 text/plain 内容类型会有什么影响?
如果您的 llms.txt 文件不是以 `Content-Type: text/plain` 标头提供的,许多 AI 爬虫会误解或完全忽略其内容。它们期望纯文本格式进行解析。如果以 HTML 或其他格式提供,指令将无法读取,从而使您的 llms.txt 文件实际上毫无用处,并允许 AI 代理无限制地访问,绕过您预期的控制。
llms.txt 中的单个 H1 网站名称如何使我的品牌受益?
llms.txt 中的单个 H1 网站名称(`# Site: 您的品牌名称`)为 AI 模型提供了清晰、明确的标识符。这种清晰性有助于 AI 代理准确归因内容,从而提高生成摘要和答案中的品牌识别度。它是跨各种 AI 平台实现一致品牌表现的基础要素,也是品牌权威的强烈信号。
为什么 llms.txt 中的 URL 必须是绝对 HTTPS 链接?
绝对 HTTPS 链接是强制性的,因为 AI 爬虫在不同的环境中运行,需要明确、安全的路径。相对 URL 在某些上下文中可能会失效或导致不正确的解析,而非 HTTPS 链接存在安全风险,并且可能会被注重安全的 AI 代理忽略。一致的 HTTPS 确保了所有 AI 驱动内容获取的完整性、安全性和可靠访问。
llms.txt 中“Docs”部分的目的是什么?
“Docs”部分(例如,`Docs: https://example.com/api-docs`)作为 AI 模型寻求结构化信息或技术文档的直接参考。它有助于 AI 理解您的数据模型、API 和复杂内容,从而在用户查询您的产品或服务时,能够生成更准确、上下文相关且详细的响应。这对于面向开发者的内容至关重要。
我应该多久验证一次我的 llms.txt 文件?
建议在您的网站结构、内容策略或 AI 交互策略发生任何更改后立即验证您的 llms.txt 文件。每月审查一次也是明智之举,以发现任何未注意到的错误或确保持续遵守不断发展的 AI 爬虫行为和最佳实践。积极验证可防止潜在的 AI 索引问题,以免其影响您的 AEO。
llms.txt 能否完全阻止所有 AI 爬虫访问我的网站?
虽然 llms.txt 为遵循道德规范的 AI 爬虫提供了强有力的指令,但它无法保证完全阻止所有机器人。恶意或不合规的抓取工具仍可能无视该文件。然而,对于 OpenAI、Google 和 Anthropic 等主要的、声誉良好的 AI 模型来说,遵守 llms.txt 指令会显著增强您控制和指导它们与您网站内容互动能力。

相关免费工具

扫描您的网站,提升AI可见性

运行免费的GEO和AEO扫描,获取为您的域名量身定制的llms.txt、robots.txt、结构化数据和内容优化建议。

免费扫描