给网站加一份 llms.txt:让大模型一次性读懂你的全站内容

0 阅读3分钟

最近在研究生成式 AI 搜索的抓取机制,发现一个新标准值得聊一聊 —— llms.txt。

背景

llms.txt(Large Language Models Specification)最早由 Answer.AI 在 2024 年提出,目的是解决一个具体问题:

大模型如何高效识别一个网站的核心内容?

传统爬虫需要遍历整个站点,分析每个页面,提取有效信息,再决定召回什么。

llms.txt 提供了一个标准:网站作者在根目录提供一个结构化的 Markdown 文件,直接告诉大模型"我是谁、我有哪些内容、核心要点是什么"。

这样大模型可以几秒钟获取全站信息,不需要逐页面爬取。

主流厂商支持情况

截至 2026 年中,主流大模型厂商都已经或正在支持 llms.txt 标准:

  • OpenAI(GPTBot)
  • Anthropic(ClaudeBot)
  • Google(Gemini)
  • Mistral
  • 国内厂商(豆包、智谱、Kimi)部分支持

标准格式说明

llms.txt 是纯 Markdown 文件,结构如下:

markdown复制

# 网站名称

> 一句话简介

## 分类 1

- [内容标题](url):简要说明
- [内容标题](url):简要说明

## 分类 2

- [内容标题](url):简要说明

完整示例

markdown复制

# 某某公司

> 主营:机械加工、零部件定制

## 服务

- [机械加工服务](/service/machining):精密机械加工
- [零部件定制](/service/custom):按图定制各类零部件

## 关于我们

- [公司简介](/about):公司介绍

部署位置

llms.txt 必须放在网站根目录:

code复制

https://你的域名/llms.txt

例如:example.com/llms.txt

llms-full.txt 增强版(可选)

对于内容较多的大型网站,可以同时提供 llms-full.txt:

markdown复制

# 网站名称

> 简介

## 核心内容

- [页面标题](url):完整内容摘要...
- [页面标题](url):完整内容摘要...

llms-full.txt 提供更详细的内容概要,适合作为 llms.txt 的补充。

技术实现建议

1. 自动生成

对于动态网站,建议用脚本自动生成:

python复制

import os
from datetime import datetime

def generate_llms_txt(site_name, sections):
    content = f"# {site_name}\n\n> 自动生成于 {datetime.now().strftime('%Y-%m-%d')}\n\n"
    
    for section_name, items in sections.items():
        content += f"## {section_name}\n\n"
        for title, url, desc in items:
            content += f"- [{title}]({url}):{desc}\n"
        content += "\n"
    
    return content

# 输出到网站根目录
with open(os.path.join(SITE_ROOT, "llms.txt"), "w", encoding="utf-8") as f:
    f.write(generate_llms_txt("我的网站", sections))

2. 静态网站

直接在项目根目录创建 llms.txt 文件,提交代码即可。

3. 验证部署

部署完成后,访问 https://yourdomain.com/llms.txt 确认能看到内容。

注意事项

1. URL 必须是绝对路径

markdown复制

# 错误
- [首页](/)

# 正确
- [首页](https://yoursite.com/)

2. 内容要简洁

llms.txt 是"目录"性质的,不是"内容"。

过多内容会让大模型抓取负担过重,反而降低效率。

3. 定期更新

网站内容更新时,llms.txt 要同步更新。

否则 AI 拿到的还是过期的"地图"。

4. robots.txt 配合

在 robots.txt 中声明 llms.txt 的位置是个好习惯:

code复制

User-agent: *
Allow: /llms.txt

与其他技术的关系

维度llms.txtsitemap.xmlSchema.org
读者大模型搜索引擎搜索引擎
用途内容索引URL 索引结构化数据
格式MarkdownXMLJSON-LD
优先级AI 时代必备传统必备增强理解

建议同时使用三种格式,形成完整的内容可发现性体系。

总结

llms.txt 是 AI 搜索时代的一个新兴标准,核心价值:

  1. 效率提升:大模型几秒获取全站信息
  2. 准确性:直接告知内容结构,减少误判
  3. 适配未来:随着大模型占比提升,重要性会越来越大

对于内容型网站,强烈建议尽快部署。