最近在研究生成式 AI 搜索的抓取机制,发现一个新标准值得聊一聊 —— llms.txt。
背景
llms.txt(Large Language Models Specification)最早由 Answer.AI 在 2024 年提出,目的是解决一个具体问题:
大模型如何高效识别一个网站的核心内容?
传统爬虫需要遍历整个站点,分析每个页面,提取有效信息,再决定召回什么。
llms.txt 提供了一个标准:网站作者在根目录提供一个结构化的 Markdown 文件,直接告诉大模型"我是谁、我有哪些内容、核心要点是什么"。
这样大模型可以几秒钟获取全站信息,不需要逐页面爬取。
主流厂商支持情况
截至 2026 年中,主流大模型厂商都已经或正在支持 llms.txt 标准:
- OpenAI(GPTBot)
- Anthropic(ClaudeBot)
- Google(Gemini)
- Mistral
- 国内厂商(豆包、智谱、Kimi)部分支持
标准格式说明
llms.txt 是纯 Markdown 文件,结构如下:
markdown复制
# 网站名称
> 一句话简介
## 分类 1
- [内容标题](url):简要说明
- [内容标题](url):简要说明
## 分类 2
- [内容标题](url):简要说明
完整示例
markdown复制
# 某某公司
> 主营:机械加工、零部件定制
## 服务
- [机械加工服务](/service/machining):精密机械加工
- [零部件定制](/service/custom):按图定制各类零部件
## 关于我们
- [公司简介](/about):公司介绍
部署位置
llms.txt 必须放在网站根目录:
code复制
https://你的域名/llms.txt
llms-full.txt 增强版(可选)
对于内容较多的大型网站,可以同时提供 llms-full.txt:
markdown复制
# 网站名称
> 简介
## 核心内容
- [页面标题](url):完整内容摘要...
- [页面标题](url):完整内容摘要...
llms-full.txt 提供更详细的内容概要,适合作为 llms.txt 的补充。
技术实现建议
1. 自动生成
对于动态网站,建议用脚本自动生成:
python复制
import os
from datetime import datetime
def generate_llms_txt(site_name, sections):
content = f"# {site_name}\n\n> 自动生成于 {datetime.now().strftime('%Y-%m-%d')}\n\n"
for section_name, items in sections.items():
content += f"## {section_name}\n\n"
for title, url, desc in items:
content += f"- [{title}]({url}):{desc}\n"
content += "\n"
return content
# 输出到网站根目录
with open(os.path.join(SITE_ROOT, "llms.txt"), "w", encoding="utf-8") as f:
f.write(generate_llms_txt("我的网站", sections))
2. 静态网站
直接在项目根目录创建 llms.txt 文件,提交代码即可。
3. 验证部署
部署完成后,访问 https://yourdomain.com/llms.txt 确认能看到内容。
注意事项
1. URL 必须是绝对路径
markdown复制
# 错误
- [首页](/)
# 正确
- [首页](https://yoursite.com/)
2. 内容要简洁
llms.txt 是"目录"性质的,不是"内容"。
过多内容会让大模型抓取负担过重,反而降低效率。
3. 定期更新
网站内容更新时,llms.txt 要同步更新。
否则 AI 拿到的还是过期的"地图"。
4. robots.txt 配合
在 robots.txt 中声明 llms.txt 的位置是个好习惯:
code复制
User-agent: *
Allow: /llms.txt
与其他技术的关系
| 维度 | llms.txt | sitemap.xml | Schema.org |
|---|---|---|---|
| 读者 | 大模型 | 搜索引擎 | 搜索引擎 |
| 用途 | 内容索引 | URL 索引 | 结构化数据 |
| 格式 | Markdown | XML | JSON-LD |
| 优先级 | AI 时代必备 | 传统必备 | 增强理解 |
建议同时使用三种格式,形成完整的内容可发现性体系。
总结
llms.txt 是 AI 搜索时代的一个新兴标准,核心价值:
- 效率提升:大模型几秒获取全站信息
- 准确性:直接告知内容结构,减少误判
- 适配未来:随着大模型占比提升,重要性会越来越大
对于内容型网站,强烈建议尽快部署。