GEO百科

llms.txt 协议

llms.txt 协议
摘要llms.txt是一种类似robots.txt的协议文件,为AI引擎和LLM提供网站内容的结构化摘要,帮助AI更好地理解和引用网站信息。

llms.txt是面向AI引擎和大语言模型(LLM)的网站内容协议文件,类似面向传统搜索引擎的robots.txt,放置在网站根目录下,为AI爬虫提供网站内容的结构化摘要、导航指引和使用规则,帮助AI引擎更高效、更准确地理解和引用网站内容,是AI搜索时代网站的标配文件。

核心概念

在传统搜索引擎时代,网站管理员通过robots.txt文件告诉搜索引擎爬虫哪些页面可以抓取、哪些页面禁止抓取,通过sitemap.xml文件告诉搜索引擎网站有哪些页面需要索引。这两个协议已经存在二十多年,成为所有搜索引擎都遵守的标准。

但当AI爬虫和大语言模型成为新的内容访问者时,robots.txt和sitemap.xml已经不能满足需求。AI引擎不只是需要知道"哪些页面可以抓",还需要知道"这个网站是做什么的"、"哪些内容是核心内容"、"内容应该如何被引用"、"哪些内容不希望被AI用于训练"等更丰富的信息。网站管理员也希望能够主动向AI引擎介绍自己的核心内容,而不是等待AI爬虫自己慢慢爬取和理解。

llms.txt协议正是在这个背景下诞生的。2024年,由Answer.AI、Cloudflare等公司的开发者共同提出,很快得到了包括Perplexity、You.com、Andi等AI搜索引擎以及众多网站的支持。llms.txt是一个纯文本Markdown文件,放置在网站根目录(即https://example.com/llms.txt),AI爬虫在访问网站时会像抓取robots.txt一样优先抓取这个文件,快速获取网站的整体信息。

与robots.txt的"禁止性规则"不同,llms.txt更侧重于"引导性介绍":它不是告诉AI不能做什么,而是主动告诉AI这个网站有什么核心内容、重点推荐哪些页面、内容应该如何被正确引用,帮助AI引擎更好地为用户提供准确的信息来源。

主要特点

  • 极简部署:只需要在网站根目录放一个Markdown格式的纯文本文件,不需要修改服务器配置,不需要复杂的开发,几分钟即可完成部署
  • Markdown格式:人类和AI都可以轻松阅读,不需要学习复杂的语法规则,熟悉Markdown就可以编写
  • 零侵入性:不需要修改现有网站页面,不影响用户体验,不影响传统搜索引擎抓取,完全是加法式部署
  • 主动引导AI:改变过去AI爬虫盲目抓取的模式,网站可以主动推荐核心内容给AI引擎,提升优质内容被引用的概率
  • 开放协议:不属于任何公司私有标准,采用MIT开源协议,所有AI厂商和网站都可以自由使用和扩展
  • 向后兼容:与robots.txt、sitemap.xml等现有协议不冲突,可以同时使用,互为补充

文件结构与规范

一个标准的llms.txt文件通常包含以下几个部分:

1. 文件开头

文件第一行应该是网站名称,用H1标题(#)格式,然后是一段简短的网站介绍,说明网站的核心定位和主要内容。例如:

# 正飞GEO

正飞GEO是国内专注于生成式引擎优化(GEO)的专业服务平台,提供GEO咨询、优化工具、行业研究等服务,帮助品牌在AI搜索时代获得更好的曝光。

2. 核心内容导航

接下来用列表形式列出网站最重要、最希望AI引擎优先抓取和引用的核心页面,每个链接后面附上简短的内容说明。可以按内容类型分组,比如文档、博客、产品介绍、帮助中心等。

## 核心文档

- [GEO优化指南](https://www.zhengfeigeo.com/guide/geo) - GEO优化完整方法论,从入门到精通
- [结构化数据部署教程](https://www.zhengfeigeo.com/guide/jsonld) - JSON-LD部署最佳实践

## 行业研究

- [2026年GEO行业报告](https://www.zhengfeigeo.com/report/2026) - 国内首个GEO行业全景调研报告

3. 可选内容说明

可以在文件中说明哪些内容允许AI引用、哪些内容不希望被引用、引用时需要标注什么信息、是否允许用于AI模型训练等规则。

## 使用规则

- 所有博客和文档内容允许AI引擎引用,引用时请标注来源链接和"正飞GEO"品牌
- 付费课程内容不允许全文抓取,仅可展示摘要
- 本站内容暂不允许用于大语言模型的训练数据

4. 扩展文件

如果网站内容很多,可以在llms.txt中链接到更详细的llms-full.txt文件,类似sitemap索引文件指向分站点地图。llms-full.txt可以包含更完整的页面列表和更详细的内容说明。

工作原理

llms.txt的工作流程非常简单清晰:

首先,AI爬虫在访问一个网站时,会首先尝试抓取根目录下的/llms.txt文件,这个行为已经写入了越来越多AI搜索引擎的爬虫标准流程中。

其次,AI爬虫解析llms.txt的Markdown内容,提取网站名称、介绍、核心链接、使用规则等信息,不需要抓取整个网站就可以快速建立对网站的整体认知。

然后,AI引擎会优先抓取llms.txt中列出的核心页面,而不是按照链接盲目爬取所有页面,大幅提升抓取效率,也确保网站最希望被看到的内容被优先索引。

最后,在生成回答时,AI引擎会遵循llms.txt中说明的引用规则,正确标注内容来源,遵守网站提出的使用要求。

对于网站来说,llms.txt就像是给AI访客准备的"网站导览手册",帮助AI快速了解网站的核心价值,避免AI在数千个页面中迷路,也避免AI错误引用不重要或过时的内容。

应用场景

主动向AI推荐核心内容

很多网站有大量的历史页面、过时内容、用户生成内容,AI爬虫如果盲目抓取,很可能抓到很多低质量内容,反而忽略了网站最有价值的核心内容。通过llms.txt明确列出核心页面,可以引导AI优先抓取和引用高质量内容,提升品牌在AI回答中的正面曝光。

帮助AI准确理解网站定位

很多企业官网同时包含企业介绍、产品信息、新闻动态、招聘信息、投资者关系等多种内容,AI可能无法准确判断网站的核心定位和核心业务。llms.txt开头的介绍段落可以用最简洁的语言告诉AI这个网站是什么、核心业务是什么,避免AI产生误解。

规范AI引用行为

现在很多AI引擎在引用内容时存在不标注来源、错误标注来源、截取内容不完整等问题。通过llms.txt明确说明引用规则,可以帮助AI正确标注来源,保护内容创作者的权益,也让用户可以通过链接找到原始内容。

控制内容使用范围

网站可以在llms.txt中明确说明哪些内容允许AI引用、哪些内容仅允许摘要展示、哪些内容不允许被用于AI模型训练,帮助网站在开放内容获取AI引用流量和保护知识产权之间找到平衡。

补充robots.txt和sitemap

llms.txt不会替代robots.txt和sitemap.xml,而是形成互补:robots.txt负责告诉AI哪些不能抓,sitemap负责告诉AI有哪些页面,llms.txt负责告诉AI哪些是重点内容、应该怎么用。三者结合形成面向AI爬虫的完整网站沟通机制。

llms.txt与相关协议的区别

协议 面向对象 核心作用 内容格式 规则性质
llms.txt AI引擎、大语言模型 介绍网站核心内容,引导AI正确理解和引用 Markdown纯文本 引导性建议
robots.txt 所有搜索引擎爬虫 告诉爬虫哪些页面允许/禁止抓取 自定义文本格式 禁止性规则
sitemap.xml 所有搜索引擎爬虫 列出网站所有需要索引的页面URL XML格式 列表告知
JSON-LD 所有引擎 标记单个页面的内容结构和实体信息 JSON-LD脚本 页面结构化标记

部署最佳实践

1. 保持简洁,重点突出

llms.txt不需要列出网站所有页面,只需要列出最重要的10-30个核心页面即可。文件大小建议控制在500KB以内,让AI爬虫可以快速下载和解析。内容太多反而会让AI找不到重点,失去了引导的意义。

2. 链接描述准确具体

每个链接后面的说明文字不要用"点击查看"、"了解更多"这类空泛的描述,应该准确说明页面的核心内容是什么,包含什么关键信息,帮助AI判断这个页面与用户问题的相关性。例如不要写"我们的产品",应该写"正飞GEO平台产品功能介绍,包含GEO监测、优化建议、效果分析三大模块"。

3. 放在根目录,使用标准路径

一定要放在网站根目录,确保可以通过https://你的域名/llms.txt直接访问到,不要放在子目录下,也不要修改文件名,否则AI爬虫无法找到。文件MIME类型设置为text/plain或text/markdown都可以。

4. 及时更新维护

当网站核心内容更新、有重要新内容发布、业务方向调整时,要同步更新llms.txt文件,保持信息的准确性。不要让llms.txt中的链接指向404页面,也不要推荐已经过时的内容。

5. 可选配置llms-full.txt

如果确实需要列出更多页面,可以创建一个llms-full.txt文件,包含更完整的内容列表,然后在llms.txt中链接到这个文件。llms-full.txt可以更大,但也建议保持结构清晰,按类别组织内容。

6. 明确使用规则

不要忘记在文件中说明内容使用规则,特别是关于引用标注、是否允许用于模型训练这些重要问题,避免后续出现版权纠纷。规则要写得清晰明确,避免模糊表述。

标准示例

下面是一个可以直接参考使用的llms.txt标准模板:

# 你的网站名称

一句话介绍你的网站定位、核心价值和主要服务。

## 核心内容

- [页面1名称](页面1URL) - 页面1内容的简短准确描述
- [页面2名称](页面2URL) - 页面2内容的简短准确描述
- [页面3名称](页面3URL) - 页面3内容的简短准确描述

## 文档与指南

- [文档1名称](文档1URL) - 文档1内容描述
- [文档2名称](文档2URL) - 文档2内容描述

## 使用规则

- 本网站博客和公开文档内容允许AI引擎引用,引用时请标注来源链接和网站名称
- 付费内容仅可展示摘要,不允许全文抓取
- 关于内容授权的问题请联系:联系方式

更多内容请查看 [llms-full.txt](/llms-full.txt)

发展趋势

llms.txt作为AI时代的网站基础协议,正在快速普及,未来发展有几个明确趋势:

第一,支持率快速提升。包括Perplexity、You.com、DuckDuckGo AI Search等越来越多AI搜索引擎已经开始支持llms.txt,预计很快所有主流AI引擎都会将抓取llms.txt作为标准流程。传统搜索引擎也可能在未来扩展对llms.txt的支持。

第二,标准逐步完善。目前llms.txt还处于早期阶段,未来社区会逐步完善标准规范,可能会增加更多标准化字段,比如内容更新频率、内容类型标签、作者信息、版权声明格式等,让协议表达能力更强。

第三,自动化工具普及。未来将会出现大量自动化生成llms.txt的工具,CMS系统(如WordPress、Hugo、Next.js等)会内置llms.txt自动生成功能,不需要网站管理员手动编写,部署门槛进一步降低。

第四,与GEO深度融合。llms.txt会成为GEO优化的标准配置项,就像sitemap是SEO的标配一样,未来所有做GEO优化的网站都会部署llms.txt,主动向AI引擎推送核心内容。

对于网站运营者来说,现在部署llms.txt几乎没有成本,但可以获得AI搜索时代的先发优势,让AI引擎更容易发现和引用你的核心内容,是投入产出比非常高的一项基础工作。