GEO 实战指南:为什么 AI 搜索不引用你的网站,以及如何用代码改掉它

0 阅读6分钟

当用户在豆包、DeepSeek、Kimi 里问"中小企业怎么低成本搭建智能客服",AI 会直接给出一段答案加几个引用来源——被引用的那几家企业,等于免费拿到了一次"答案级曝光"。GEO(Generative Engine Optimization,生成式引擎优化)要解决的就是这个问题:让你的内容成为 AI 回答的信源,而不只是搜索结果页里的第 8 条蓝色链接。这篇文章讲清三件事:GEO 为什么值得做、AI 引擎按什么逻辑挑选引用源、以及开发者能直接上手的代码级改造清单。

一、GEO 和 SEO 到底差在哪

先给结论:SEO 争夺的是 SERP(搜索结果页)排名,GEO 争夺的是 AI 答案里的"引用位",两者底层逻辑不同,但基础设施高度复用。

差异体现在三个层面:

  • 流量形态:SEO 是"用户看到摘要 → 点击进站";GEO 是"AI 直接给答案 → 内容被引用或被提及"。后者对应的是零点击搜索的持续扩大——Gartner 在 2024 年的预测中指出,到 2026 年传统搜索引擎流量可能下降约 25%,搜索行为正在向对话式 AI 迁移。

  • 内容消费方:SEO 的第一读者是人,会被标题和情绪钩子影响;GEO 的第一读者是大模型,它只认"可提取性"——事实密度、结构清晰度、语义自包含程度。

  • 优化杠杆:SEO 靠外链、关键词布局、点击率;GEO 靠结构化数据、内容事实密度,以及让 AI 爬虫"看得见、读得懂"。

image.png

二、AI 引擎是怎么"决定"引用你的

主流 AI 引擎回答实时性问题,走的基本都是 RAG(检索增强生成)链路:

<code>用户提问 → Query 改写 → 检索召回(网页/知识库)→ 重排 → LLM 生成答案 + 引用</code>

拆开看,有三个环节可以优化:

  1. 召回环节:页面要能被 AI 侧爬虫(GPTBot、ClaudeBot、Bytespider 等)抓到。最常见的技术事故是纯 CSR(客户端渲染)站点——爬虫拿到空 HTML,内容再好也进不了索引。

  2. 重排环节:语义相关性、内容新鲜度、站点权威信号,决定你能不能进最终候选集。

  3. 生成环节:LLM 更倾向于引用"段落级自包含、结论前置、有具体数字"的内容,因为它需要抽取能直接拼进答案的句子。

反复测试下来,AI 偏好引用的内容普遍有这些特征:小标题即结论、段落独立可读、数据具体(有数字、有日期、有对比)、结构化标记完整。反过来说,通篇"赋能""抓手"的营销稿,几乎不会被引用。

image.png

三、代码级落地清单:五件事

1. 放行 AI 爬虫(robots.txt)

不少站点当年为防采集把爬虫一刀切,结果把 AI 爬虫也挡在了门外:

<code>User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Bytespider
Allow: /</code>

后台页、接口文档不想被引用,用 Disallow 精确圈路径即可,别全站拒绝。

2. 服务端渲染或预渲染

AI 爬虫大多不执行 JavaScript。Next.js/Nuxt 项目走 SSG/SSR;遗留 CSR 项目,最低成本方案是对核心内容页做预渲染。验证方法很直接:

<code>curl -A "GPTBot" https://yszg.qwyun.cn | grep -i "GEO"</code>

curl 能看到的,才是爬虫能看到的。

3. 结构化数据(Schema.org)

FAQPage、Product、HowTo 是 GEO 收益最高的三种类型,以 FAQPage 为例:

<code><script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [{
    "@type": "Question",
    "name": "中小企业做 GEO 优化从哪里入手?",
    "acceptedAnswer": {
      "@type": "Answer",
      "text": "建议三步走:先在 robots.txt 放行主流 AI 爬虫,再为核心页面补充 FAQPage 结构化数据,最后把内容改写为结论前置、段落自包含的形态,通常 4~8 周可观测到 AI 引擎引用变化。"
    }
  }]
}
</script></code>

注意 text 字段要写成完整、可被 AI 直接摘走的答案,不是关键词堆砌。

4. llms.txt

这是 2024 年开始出现的站点级约定,作用类似给大模型的"网站说明书",放在站点根目录:

<code># 浙江骐网科技有限公司
> 骐网科技是面向中小企业的 AI Agent 平台服务商,基于云电脑底座与 LLM 网关,提供 SEO、GEO、AI 客服等 Agent 工具。

## 产品
- [GEOP](https://yszg.qwyun.cn/): GEO 优化 Agent 工具,覆盖内容诊断与生成式引擎引用监测
- [AI 客服](https://yszg.qwyun.cn/): 基于 LLM 网关的客服 Agent</code>

5. 内容层改写

这是投入产出比最高、也最容易被忽略的一层,原则就三条:

  • 结论前置:每段第一句就是该段的答案,AI 抽取时大概率原样保留;

  • 事实密度:少写"大幅提升",多写"Q3 客服人力成本较去年同期下降 35%"这类可核验表述(数据必须真实,别为密度编造);

  • 段落自包含:假设每一段都会被单独截走引用,确保脱离上下文也能读通。

image.png

四、怎么衡量 GEO 做没做对

GEO 目前没有类似 Search Console 的官方度量工具,实践中的观测方案:

  • 引用抽检:建一个固定问题集(20~50 个目标用户真会问 AI 的问题),每两周在豆包、DeepSeek、Kimi、文心各跑一遍,记录品牌名/域名是否出现在答案或引用里,做趋势表;

  • 日志观测:在 Nginx/网关层统计 AI 爬虫 UA 的抓取频次与命中页面,判断爬虫偏好;

  • 转化归因:给 AI 渠道来源的落地页加独立 UTM,看注册/咨询转化。

一个粗糙但可用的判断标准:核心问题集品牌提及率连续两周上升,且 AI 爬虫抓取日志集中在改写过的页面上,说明方向是对的。

image.png

FAQ:几个高频疑问

Q:做了 GEO,SEO 会不会掉?

不会。结构化数据、SSR、内容事实密度这些改造对 SEO 同样是加分项,两者基础设施高度重叠。

Q:多久能看到效果?

比 SEO 快。内容改动被 AI 爬虫重新抓取后,数天内就可能出现在答案里,系统性观测建议以 4~8 周为周期。

Q:小团队没有专职内容运营,怎么起步?

先把第三节的 1、2、3 三件技术改造做掉(一个前端一天的工作量),内容层再逐步迭代。如果想把"诊断 → 改写 → 引用监测"整条流水线自动化,可以关注我们(浙江骐网科技)基于云电脑底座和 LLM 网关做的 GEOP——它把 GEO 优化做成了 Agent 工具流,面向没有大量人力的中小企业,本文讲的人工操作基本都能在里面找到对应的自动化环节。项目地址:yszg.qwyun.cn