GEO 到底怎么做?从 Prompt 研究到 AI Citation 的完整落地方法

前面介绍 GEO 时,我们很容易把它理解成:

把文章写得更适合 ChatGPT、Gemini、Perplexity 这些 AI 引用。

但真正研究一圈 GEO 厂商和开源项目之后,会发现:

这其实只是 GEO 很小的一部分。

Profound、Peec AI、Scrunch 等商业产品,以及 Elmo、Gego 这些开源项目,真正投入最多的能力都不是"帮你改几段文章",而是:

Prompt 监测、品牌可见度、Citation 分析、Source Gap、Crawler 访问、竞品分析以及持续复测。

例如 Profound 的核心流程,就是围绕真实 Prompt 建立每日监测,记录不同 Answer Engine 的完整回答、引用来源以及品牌可见度;Peec 则进一步把 Brand Visibility 和 Source Visibility 分开分析;开源项目 Gego 和 Elmo 也都采用"定时执行 Prompt → 保存 Answer → 提取 Mention/Citation → 做趋势分析"的基本架构。

所以如果重新定义 GEO,我更愿意把它描述成:

GEO 是围绕生成式搜索建立的一套 AI Visibility Engineering。

它要解决的不是一个问题,而是一条完整链路:

text 复制代码
用户到底会问什么?
        ↓
AI 现在怎么回答?
        ↓
AI 为什么引用这些网站?
        ↓
为什么竞争对手出现了,我没有?
        ↓
应该改网站、改内容,还是建设外部信源?
        ↓
修改之后有没有真的变好?

真正的 GEO,就从这里开始。


一、第一步不是写内容,而是建立 Prompt Dataset

传统 SEO 的起点通常是:

text 复制代码
Keyword Research

GEO 的起点应该变成:

text 复制代码
Prompt Research

这是两者之间一个非常重要的变化。

例如你是一家企业 RAG 产品厂商。

传统 SEO 可能会关注:

text 复制代码
RAG
RAG Platform
RAG Framework
企业知识库
RAG SaaS

但是用户使用 ChatGPT 时,很少只输入:

text 复制代码
RAG Platform

更可能直接问:

text 复制代码
企业内部知识库应该怎么做?

有哪些比较成熟的企业 RAG 平台?

LangChain 和 LlamaIndex 哪个更适合企业?

有哪些支持私有化部署的 RAG 产品?

金融行业做 RAG 应该注意什么?

RAG 准确率低一般是什么原因?

有没有支持权限控制的企业知识库方案?

这意味着我们真正需要建立的是:

text 复制代码
              RAG Prompt Universe

                   │
       ┌───────────┼───────────┐
       │           │           │
   Information   Comparison   Recommendation
       │           │           │
    是什么?       A vs B       推荐哪些?
    为什么?       谁更好?      哪个最好?

                   │
       ┌───────────┼───────────┐
       │           │           │
     Problem     Commercial   Transaction
       │           │           │
    怎么解决?     产品选型      买哪个?
    为什么不准?   企业方案      多少钱?

然后继续增加几个维度:

text 复制代码
Persona
├─ 开发者
├─ 架构师
├─ CTO
└─ 采购负责人

Region
├─ 中国
├─ 美国
└─ 欧洲

Language
├─ 中文
└─ 英文

最终得到的不是 20 个 Keyword,而可能是:

200~1000 个真实 Prompt。

这就是整个 GEO 系统的测试集。

Profound 现在甚至专门提供 Prompt Volumes 和 Prompt Research,用真实 AI 对话数据判断哪些问题真正有人在问,因为如果 Prompt 本身选错了,后面所有 GEO 优化都可能是在优化一个根本不存在的需求。

这其实和做 Agent Evaluation 很像:

没有 Dataset,就谈不上 Evaluation;没有 Prompt Dataset,同样谈不上 GEO。


二、第二步:建立 GEO Baseline,先知道 AI 现在怎么看你

有了 Prompt Dataset 以后,不要急着修改网站。

先跑一遍。

例如:

text 复制代码
300 Prompts

×
ChatGPT
Gemini
Perplexity
Copilot
Google AI

×
不同地区

×
多次 Run

为什么一个 Prompt 要重复跑?

因为生成式回答不是传统搜索排名。

同一个问题:

text 复制代码
有哪些优秀的 Agent Evaluation Framework?

今天 ChatGPT 可能回答:

text 复制代码
LangSmith
DeepEval
Braintrust
Arize

明天可能变成:

text 复制代码
LangSmith
Braintrust
Phoenix
DeepEval

Profound 就明确采用每日运行 Prompt 的方式,因为 Answer Engine 不会每次返回完全相同的答案。

所以每次 Run 至少要保存:

text 复制代码
Prompt

Engine

Model

Region

Language

Raw Answer

Brand Mentions

Mention Position

Competitor Mentions

Citation URLs

Source Domains

Timestamp

最好不要只保存最终算出来的一个:

text 复制代码
GEO Score = 82

而应该保留:

text 复制代码
Raw Response

因为以后你的算法变了,还可以重新计算。

Gego 的实现就非常典型:

text 复制代码
Scheduler
    ↓
Worker
    ↓
OpenAI / Anthropic / Google / Perplexity
    ↓
Response
    ↓
Citation Extraction
    ↓
Brand Detection
    ↓
Database
    ↓
Analytics

它支持定时任务、Retry、Brand Alias、Citation URL、Top Cited Domain、Keyword × Domain 等分析,本质上已经是一套完整的 GEO Monitoring Backend。

Elmo 走的也是类似路线,而且把自己明确定位成开源 AI Visibility Tracking Platform。

所以 GEO 的第一套核心系统,其实不是 Content Generator。

而是:


三、第三步:不要只看"有没有我",要分析 AI 为什么这么回答

有了数据以后,就可以开始算指标。

最基础的是:

Brand Visibility

例如一共执行了 1000 次相关 Prompt:

text 复制代码
320 次回答出现你的品牌

那么:

text 复制代码
Visibility Rate = 32%

然后是:

Citation Rate

text 复制代码
1000 次回答

120 次引用你的官网

Citation Rate = 12%

再进一步看:

text 复制代码
Share of Voice

Competitor A    48%

Your Brand      32%

Competitor B    26%

Competitor C    18%

还可以统计:

text 复制代码
Average Mention Position

Citation Domain

Citation URL

Sentiment

Prompt Coverage

Model Coverage

但这里有一个非常重要的指标设计。

Peec AI 会把:

text 复制代码
Brand Visibility

和:

text 复制代码
Source Visibility

分开。

为什么?

因为这两个指标反映的是完全不同的问题。

比如:

text 复制代码
AI 经常推荐你的品牌
但是很少引用你的官网

说明:

AI 知道你是谁,但是获取关于你的信息时主要依赖第三方网站。

反过来:

text 复制代码
你的文章经常被引用
但是 AI 很少推荐你的品牌

说明:

你的内容有信息价值,但品牌和这个领域之间的 Entity Association 还不够强。

这两个问题的解决方法完全不一样。

第一个可能应该加强:

text 复制代码
官网权威内容
产品文档
案例
数据
Original Research

第二个可能应该加强:

text 复制代码
品牌 Entity
行业媒体
第三方评价
社区讨论
Benchmark
PR

所以真正成熟的 GEO 不能只有一个总分。

必须能够:

诊断。


四、第四步:做 Citation Intelligence,而不是看到排名低就疯狂改官网

这是 GEO 和传统 SEO 在执行层面非常不同的一个地方。

假设用户问:

有哪些优秀的 Agent Evaluation Framework?

AI 回答:

text 复制代码
LangSmith
DeepEval
Braintrust
Arize

你自己的产品没有出现。

最简单粗暴的方法是:

马上写一篇《2026 最好的 Agent Evaluation Framework》。

但这不一定解决问题。

真正应该先做的是:

AI 为什么推荐了它们?

把所有回答的 Citation 拉出来。

可能会发现:

text 复制代码
                     AI Answer

                         │
           ┌─────────────┼─────────────┐
           │             │             │
         GitHub         Reddit         G2
           │             │             │
       Star / Docs      Discussion     Review

                         │
              Technical Blog / Media

这时候真正的问题就变成:

AI 在这个 Topic 下主要相信哪些 Source?

继续统计:

text 复制代码
Top Citation Domains

reddit.com       18%
github.com       15%
g2.com           11%
某技术媒体          8%
竞品官网            7%

再看:

text 复制代码
竞争对手被哪些页面推荐?

我是在哪些 Source 上缺席的?

这就是:

Source Gap Analysis

Peec 甚至会按照 Source Type 对引用来源进行分类,因为不同 Source 的解决方法完全不一样。

例如:

Source 类型 GEO 动作
Own Website 内容优化
Editorial PR / 媒体
UGC Community
Review 用户评价
Corporate 合作 / Directory
Reference 权威资料 / 数据库

所以一个非常重要的认识是:

GEO 不是只优化自己的网站。

如果 AI 对某个问题主要参考:

text 复制代码
Reddit
GitHub
G2
行业媒体
第三方 Benchmark

那么你官网再写 100 篇文章,也未必能够解决 Source Gap。

这也是为什么 GEO 最后一定会和:

text 复制代码
SEO
+
Content Marketing
+
Digital PR
+
Community
+
Open Source

发生融合。


五、第五步:Technical GEO,保证 AI 真的能访问你

Source Gap 分析完之后,再回到自己的网站。

首先解决的不是文章写法,而是:

AI Search 到底能不能正常获取你的内容?

这一层我会称为:

Technical GEO

它和 Technical SEO 高度重合。

Google 在 2026 年发布的生成式 AI Search 指南已经明确说明,Google AI Overviews 和 AI Mode 仍然建立在核心 Search Ranking、Search Index 和 RAG Retrieval 机制之上,因此传统 SEO 的 Crawling、Indexing 和 Technical Structure 仍然是基础。

所以至少要检查:

text 复制代码
robots.txt

Crawler Access

HTTP Status

Canonical

Index

Sitemap

Internal Link

JavaScript Rendering

SSR / SSG

Page Speed

Structured Data

Duplicate Content

对于 ChatGPT Search,OpenAI 官方也明确说明:

如果希望网页能够出现在 ChatGPT Search 的摘要和 Citation 中,需要允许 OAI-SearchBot 访问。

而且:

text 复制代码
OAI-SearchBot

和:

text 复制代码
GPTBot

用途并不相同。

这意味着企业完全可以根据自己的策略分别控制:

text 复制代码
搜索发现

和

模型训练

这一点对企业网站尤其重要。

Scrunch 甚至专门把 Site Audit 拆成:

text 复制代码
Access Control

Content Delivery

Content Quality

并进一步监控 AI Bot Traffic,看哪些 AI Crawler 真正在访问哪些页面。

所以真正成熟的 Technical GEO 应该进一步接入:

text 复制代码
CDN Log

Nginx Log

WAF Log

然后统计:

text 复制代码
Googlebot

OAI-SearchBot

Perplexity Bot

其他 AI Agent

究竟访问了:

text 复制代码
哪些页面

访问多少次

状态码是多少

有没有被 WAF 拦截

有没有因为 JS 获取不到正文

这才是真正的:

AI Crawler Observability。


六、第六步:Content GEO,核心不是"AI 文风",而是信息价值

解决完 Retrieval 问题以后,才轮到内容本身。

这里也是目前 GEO 最容易被做成玄学的地方。

网上经常可以看到:

text 复制代码
多加 FAQ

多写数字

每 300 字切一次

多引用权威网站

写得更像百科

增加 llms.txt

然后包装成:

GEO 最佳实践。

但目前至少 Google 已经明确表示:

不需要为了 Google 的生成式搜索专门创建 llms.txt、特殊 AI Markup 或所谓 AI Chunking。Google 更强调的是传统 Technical SEO,以及独特、有价值、非同质化的内容。

所以真正值得优化的是四件事情:

text 复制代码
Relevance

这个页面是不是真的回答了问题?
        ↓

Information Gain

有没有别人没有的信息?
        ↓

Evidence

重要结论有没有证据?
        ↓

Extractability

信息是不是容易准确理解和提取?

例如这句话:

Reranker 可以明显提高 RAG 的准确率。

几乎没有什么信息价值。

但是如果写成:

text 复制代码
测试规模:

120 万 Chunk

Embedding:

BGE-M3

Retriever:

Milvus

TopK:

30

Reranker:

BGE-Reranker

Without Rerank:

Recall@5 = 72.4%

With Rerank:

Recall@5 = 84.1%

代价:

P95 Latency
280ms → 510ms

然后再告诉读者:

text 复制代码
为什么提升?

哪些 Query 提升最大?

哪些 Query 没提升?

为什么最终仍然上线?

测试数据有什么限制?

这篇内容就拥有了:

Information Gain

因为 AI 可以自己生成:

什么是 Reranker。

但是 AI 不知道:

你的生产环境中 Reranker 到底发生了什么。

Google 当前针对 Generative AI Search 也明确强调 Unique、Expert-led、Non-commodity Content,而不是简单批量生成已有信息的重新组织版。

因此 GEO 时代技术内容真正应该增加的是:

text 复制代码
真实数据

Benchmark

源码

架构图

实验

失败案例

生产经验

第一手观察

而不是简单增加字数。


七、第七步:不要忽略 Query Fan-out

GEO 还有一个和传统 SEO 非常不同的地方:

AI 不一定拿用户原问题直接 Search。

例如用户问:

最好的企业 RAG 平台是什么?

后台可能进一步生成:

text 复制代码
enterprise RAG platforms

secure enterprise RAG

RAG access control

RAG platform comparison

RAG deployment options

best RAG software 2026

这就是:

Query Fan-out

Google 已经公开说明 AI Search 中会使用 Query Fan-out,通过多个相关 Query 并行检索更多信息。

Elmo 现在也已经开始直接展示:

text 复制代码
Prompt
 ↓
AI 实际展开了哪些 Search Query

甚至分析:

text 复制代码
AI 增加了哪些词

删除了哪些词

哪些 Fan-out Query 你没有覆盖

这意味着 GEO 内容策略不能只围绕:

text 复制代码
Best RAG Platform

而应该继续覆盖:

text 复制代码
Security

Pricing

Deployment

Access Control

Benchmark

Comparison

Integration

Review

所以 GEO 的内容结构最终会越来越像:

text 复制代码
              Topic

                ↓

          Question Graph

                ↓

          Fan-out Query

                ↓

         Knowledge Network

这其实比传统 Keyword Expansion 更接近真实的 AI Retrieval。


八、第八步:修改以后一定要重新跑 Benchmark

这是整个 GEO 最重要,也最容易被忽视的一步。

很多所谓 GEO 服务是:

text 复制代码
扫描网站
   ↓
给你 73 分
   ↓
AI 重写文章
   ↓
发布
   ↓
结束

但这不叫真正的优化。

因为:

你根本不知道修改有没有效果。

正确方式应该像做模型 Evaluation:

text 复制代码
Baseline
   ↓
提出 Hypothesis
   ↓
修改
   ↓
重新执行 Prompt Dataset
   ↓
比较 Before / After

比如发现:

text 复制代码
Prompt Cluster:

Agent Evaluation

Baseline Visibility:

18%

Citation Rate:

6%

然后你做了:

text 复制代码
新增 Benchmark

补充 Agent Eval 方法论

增加 GitHub Example

完善 Structured Data

在几个高 Citation Source 获得真实 Mention

4 周后重新跑:

text 复制代码
Visibility:

18% → 29%

Citation:

6% → 13%

这才说明:

修改可能有效。

如果:

text 复制代码
18% → 17%

那就不能因为文章"看起来更 GEO"而自我安慰。

应该:

text 复制代码
分析

↓

Rollback / 调整

↓

继续 Experiment

最终形成:

text 复制代码
Experiment 001

Experiment 002

Experiment 003

...

然后逐渐得到:

什么策略对我的行业、我的网站、我的目标 Engine 真正有效。

这其实就是 GEO 最应该具备的科学性。


九、最终,GEO 应该形成这样一套系统

把前面的东西放在一起,一个完整 GEO Platform 可以设计成:

text 复制代码
                 GEO Platform

                      │
              Prompt Dataset
                      │
                      ▼
              Multi-Engine Runner
                      │
        ┌─────────────┼─────────────┐
        │             │             │
     ChatGPT        Gemini      Perplexity
        │             │             │
        └─────────────┼─────────────┘
                      ▼
                Response Store
                      │
                      ▼
                Analysis Engine
                      │
       ┌──────────────┼──────────────┐
       │              │              │
    Mention        Citation       Fan-out
       │              │              │
       └──────────────┼──────────────┘
                      ▼
               Competitor Graph
                      │
                      ▼
                Gap Analysis
                      │
          ┌───────────┴───────────┐
          │                       │
     Owned Website           External Source
          │                       │
   Technical / Content      PR / UGC / Review
          │                       │
          └───────────┬───────────┘
                      ▼
                 Experiment
                      │
                      ▼
                  Re-run
                      │
                      ▼
               Before / After

这时候 GEO 就不再是一套"内容优化技巧"。

而变成了:

一套围绕 AI Search 的可观测、分析、优化和实验系统。


十、最后总结:真正做 GEO,只需要记住这七步

如果把整篇文章压缩成一套可以直接执行的方法,就是:

text 复制代码
1. Prompt Research

用户真正会问什么?
        ↓

2. Baseline

AI 现在怎么回答?
        ↓

3. Citation Intelligence

AI 为什么引用这些 Source?
        ↓

4. Gap Analysis

为什么竞争对手有,我没有?
        ↓

5. Optimization

Technical + Content + Off-site
        ↓

6. Experiment

修改之后重新跑 Dataset
        ↓

7. Measurement

Visibility / Citation / SOV / Traffic / Revenue

最终形成一个循环:

text 复制代码
Research

   ↓

Measure

   ↓

Analyze

   ↓

Optimize

   ↓

Evaluate

   ↓

Learn

   ↓

Repeat

这才是我认为目前最合理的 GEO 方法论。


写在最后

如果一定要用一句话解释"GEO 到底怎么做",我会说:

不要想办法让 AI"喜欢"你的文章,而是想办法让你的信息,在 AI 的 Retrieval、Context、Generation 和 Citation 链路里具备更高竞争力。

这两种思路差别非常大。

前者容易走向:

text 复制代码
关键词

FAQ

Prompt Trick

llms.txt

固定模板

后者则会走向:

text 复制代码
Prompt Dataset

AI Search Observability

Citation Graph

Source Gap

Information Gain

Entity Authority

Experiment

Evaluation

而真正有长期价值的 GEO,一定是后者。

SEO 时代,我们优化的是:

Page Ranking。

GEO 时代,我们正在开始优化:

Information Visibility。

所以真正需要建设的也不再只是一篇"SEO 文章",而是一整套:

网站 + 内容 + Entity + 外部信源 + AI Search 数据 + Evaluation System。

这才是 GEO 真正开始变得有技术含量的地方。


参考资料

  1. Google Search Central:2026 年发布针对 AI Overviews、AI Mode 等生成式搜索功能的官方优化指南,强调传统 SEO、可抓取性和独特内容仍然是基础。

  2. Microsoft Bing Webmaster Tools:2026 年推出 AI Performance,可以查看 Total Citations、Grounding Queries、Page-level Citation 等 GEO 指标。

  3. OpenAI Publishers and Developers FAQ:介绍 OAI-SearchBot、ChatGPT Search 可发现性及 Citation 相关控制方式。

  4. Profound Answer Engine Insights:围绕 Prompt Tracking、Visibility、Citation 和 Share of Voice 建立 AI Search Monitoring。

  5. Peec AI:将 Brand Visibility 与 Source Visibility 分开,并基于 Citation Source 做 Gap Analysis。

  6. Elmo:开源 AI Visibility / GEO Monitoring 平台,支持多 Answer Engine 的 Mention、Citation 和竞品监测。

  7. Gego:开源 GEO Tracker,提供 Multi-LLM Prompt Scheduling、Citation Tracking、Brand Tracking 和 Analytics。

相关推荐
yingyuecom1 小时前
映悦AI × Joverse全球发布:四大重磅更新,AI创作进入工业化时代
人工智能·gpt·chatgpt·prompt·aigc
会周易的程序员1 小时前
软件接入大模型实现 Agent —— 从原理到 C++ 落地完全指南
c++·人工智能·物联网·架构·agent·工业协议·mcp
躺柒1 小时前
读数据可视化13空间标量场(上)
人工智能·深度学习·信息可视化·数据可视化·空间·大数据分析
小王2041 小时前
Day 28:目标检测入门 — 两阶段 vs 单阶段
人工智能·目标检测·计算机视觉
CIO_Alliance1 小时前
AI深度系列(3)| 从RNN到LSTM:序列数据处理的技术逻辑与企业AI化转型启示
人工智能·rnn·深度学习·神经网络·lstm·企业cio联盟·企业级ai化转型
像风一样自由20201 小时前
11.PostgreSQ、-MySQL与MongoDB-AI应用如何选择数据库
数据库·人工智能·mysql·mongodb·大模型·rag·智能体
随风而飘1861 小时前
Keithley美国吉时利 2016-P 6.5位音频分析数字多用表
网络·人工智能·功能测试
2401_890095611 小时前
如何判断武汉人工智能应用软件开发是否适用?从部署步骤入手
人工智能·武汉自动意志科技有限公司·智钳claw·人工智能应用软件开发·企业ai智能体系统·企业数字化服务
东莞市奥普新音频技术有限公司1 小时前
国产音频分析仪怎么选?从性能参数、测试软件到自动化能力
人工智能·科技·测试工具·自动化·音视频·音频