
前面介绍 GEO 时,我们很容易把它理解成:
把文章写得更适合 ChatGPT、Gemini、Perplexity 这些 AI 引用。
但真正研究一圈 GEO 厂商和开源项目之后,会发现:
这其实只是 GEO 很小的一部分。
Profound、Peec AI、Scrunch 等商业产品,以及 Elmo、Gego 这些开源项目,真正投入最多的能力都不是"帮你改几段文章",而是:
Prompt 监测、品牌可见度、Citation 分析、Source Gap、Crawler 访问、竞品分析以及持续复测。
例如 Profound 的核心流程,就是围绕真实 Prompt 建立每日监测,记录不同 Answer Engine 的完整回答、引用来源以及品牌可见度;Peec 则进一步把 Brand Visibility 和 Source Visibility 分开分析;开源项目 Gego 和 Elmo 也都采用"定时执行 Prompt → 保存 Answer → 提取 Mention/Citation → 做趋势分析"的基本架构。
所以如果重新定义 GEO,我更愿意把它描述成:
GEO 是围绕生成式搜索建立的一套 AI Visibility Engineering。
它要解决的不是一个问题,而是一条完整链路:
text
用户到底会问什么?
↓
AI 现在怎么回答?
↓
AI 为什么引用这些网站?
↓
为什么竞争对手出现了,我没有?
↓
应该改网站、改内容,还是建设外部信源?
↓
修改之后有没有真的变好?
真正的 GEO,就从这里开始。
一、第一步不是写内容,而是建立 Prompt Dataset
传统 SEO 的起点通常是:
text
Keyword Research
GEO 的起点应该变成:
text
Prompt Research
这是两者之间一个非常重要的变化。
例如你是一家企业 RAG 产品厂商。
传统 SEO 可能会关注:
text
RAG
RAG Platform
RAG Framework
企业知识库
RAG SaaS
但是用户使用 ChatGPT 时,很少只输入:
text
RAG Platform
更可能直接问:
text
企业内部知识库应该怎么做?
有哪些比较成熟的企业 RAG 平台?
LangChain 和 LlamaIndex 哪个更适合企业?
有哪些支持私有化部署的 RAG 产品?
金融行业做 RAG 应该注意什么?
RAG 准确率低一般是什么原因?
有没有支持权限控制的企业知识库方案?
这意味着我们真正需要建立的是:
text
RAG Prompt Universe
│
┌───────────┼───────────┐
│ │ │
Information Comparison Recommendation
│ │ │
是什么? A vs B 推荐哪些?
为什么? 谁更好? 哪个最好?
│
┌───────────┼───────────┐
│ │ │
Problem Commercial Transaction
│ │ │
怎么解决? 产品选型 买哪个?
为什么不准? 企业方案 多少钱?
然后继续增加几个维度:
text
Persona
├─ 开发者
├─ 架构师
├─ CTO
└─ 采购负责人
Region
├─ 中国
├─ 美国
└─ 欧洲
Language
├─ 中文
└─ 英文
最终得到的不是 20 个 Keyword,而可能是:
200~1000 个真实 Prompt。
这就是整个 GEO 系统的测试集。
Profound 现在甚至专门提供 Prompt Volumes 和 Prompt Research,用真实 AI 对话数据判断哪些问题真正有人在问,因为如果 Prompt 本身选错了,后面所有 GEO 优化都可能是在优化一个根本不存在的需求。
这其实和做 Agent Evaluation 很像:
没有 Dataset,就谈不上 Evaluation;没有 Prompt Dataset,同样谈不上 GEO。
二、第二步:建立 GEO Baseline,先知道 AI 现在怎么看你
有了 Prompt Dataset 以后,不要急着修改网站。
先跑一遍。
例如:
text
300 Prompts
×
ChatGPT
Gemini
Perplexity
Copilot
Google AI
×
不同地区
×
多次 Run
为什么一个 Prompt 要重复跑?
因为生成式回答不是传统搜索排名。
同一个问题:
text
有哪些优秀的 Agent Evaluation Framework?
今天 ChatGPT 可能回答:
text
LangSmith
DeepEval
Braintrust
Arize
明天可能变成:
text
LangSmith
Braintrust
Phoenix
DeepEval
Profound 就明确采用每日运行 Prompt 的方式,因为 Answer Engine 不会每次返回完全相同的答案。
所以每次 Run 至少要保存:
text
Prompt
Engine
Model
Region
Language
Raw Answer
Brand Mentions
Mention Position
Competitor Mentions
Citation URLs
Source Domains
Timestamp
最好不要只保存最终算出来的一个:
text
GEO Score = 82
而应该保留:
text
Raw Response
因为以后你的算法变了,还可以重新计算。
Gego 的实现就非常典型:
text
Scheduler
↓
Worker
↓
OpenAI / Anthropic / Google / Perplexity
↓
Response
↓
Citation Extraction
↓
Brand Detection
↓
Database
↓
Analytics
它支持定时任务、Retry、Brand Alias、Citation URL、Top Cited Domain、Keyword × Domain 等分析,本质上已经是一套完整的 GEO Monitoring Backend。
Elmo 走的也是类似路线,而且把自己明确定位成开源 AI Visibility Tracking Platform。
所以 GEO 的第一套核心系统,其实不是 Content Generator。
而是:
AI Search Observability
三、第三步:不要只看"有没有我",要分析 AI 为什么这么回答
有了数据以后,就可以开始算指标。
最基础的是:
Brand Visibility
例如一共执行了 1000 次相关 Prompt:
text
320 次回答出现你的品牌
那么:
text
Visibility Rate = 32%
然后是:
Citation Rate
text
1000 次回答
120 次引用你的官网
Citation Rate = 12%
再进一步看:
text
Share of Voice
Competitor A 48%
Your Brand 32%
Competitor B 26%
Competitor C 18%
还可以统计:
text
Average Mention Position
Citation Domain
Citation URL
Sentiment
Prompt Coverage
Model Coverage
但这里有一个非常重要的指标设计。
Peec AI 会把:
text
Brand Visibility
和:
text
Source Visibility
分开。
为什么?
因为这两个指标反映的是完全不同的问题。
比如:
text
AI 经常推荐你的品牌
但是很少引用你的官网
说明:
AI 知道你是谁,但是获取关于你的信息时主要依赖第三方网站。
反过来:
text
你的文章经常被引用
但是 AI 很少推荐你的品牌
说明:
你的内容有信息价值,但品牌和这个领域之间的 Entity Association 还不够强。
这两个问题的解决方法完全不一样。
第一个可能应该加强:
text
官网权威内容
产品文档
案例
数据
Original Research
第二个可能应该加强:
text
品牌 Entity
行业媒体
第三方评价
社区讨论
Benchmark
PR
所以真正成熟的 GEO 不能只有一个总分。
必须能够:
诊断。
四、第四步:做 Citation Intelligence,而不是看到排名低就疯狂改官网
这是 GEO 和传统 SEO 在执行层面非常不同的一个地方。
假设用户问:
有哪些优秀的 Agent Evaluation Framework?
AI 回答:
text
LangSmith
DeepEval
Braintrust
Arize
你自己的产品没有出现。
最简单粗暴的方法是:
马上写一篇《2026 最好的 Agent Evaluation Framework》。
但这不一定解决问题。
真正应该先做的是:
AI 为什么推荐了它们?
把所有回答的 Citation 拉出来。
可能会发现:
text
AI Answer
│
┌─────────────┼─────────────┐
│ │ │
GitHub Reddit G2
│ │ │
Star / Docs Discussion Review
│
Technical Blog / Media
这时候真正的问题就变成:
AI 在这个 Topic 下主要相信哪些 Source?
继续统计:
text
Top Citation Domains
reddit.com 18%
github.com 15%
g2.com 11%
某技术媒体 8%
竞品官网 7%
再看:
text
竞争对手被哪些页面推荐?
我是在哪些 Source 上缺席的?
这就是:
Source Gap Analysis
Peec 甚至会按照 Source Type 对引用来源进行分类,因为不同 Source 的解决方法完全不一样。
例如:
| Source 类型 | GEO 动作 |
|---|---|
| Own Website | 内容优化 |
| Editorial | PR / 媒体 |
| UGC | Community |
| Review | 用户评价 |
| Corporate | 合作 / Directory |
| Reference | 权威资料 / 数据库 |
所以一个非常重要的认识是:
GEO 不是只优化自己的网站。
如果 AI 对某个问题主要参考:
text
Reddit
GitHub
G2
行业媒体
第三方 Benchmark
那么你官网再写 100 篇文章,也未必能够解决 Source Gap。
这也是为什么 GEO 最后一定会和:
text
SEO
+
Content Marketing
+
Digital PR
+
Community
+
Open Source
发生融合。
五、第五步:Technical GEO,保证 AI 真的能访问你
Source Gap 分析完之后,再回到自己的网站。
首先解决的不是文章写法,而是:
AI Search 到底能不能正常获取你的内容?
这一层我会称为:
Technical GEO
它和 Technical SEO 高度重合。
Google 在 2026 年发布的生成式 AI Search 指南已经明确说明,Google AI Overviews 和 AI Mode 仍然建立在核心 Search Ranking、Search Index 和 RAG Retrieval 机制之上,因此传统 SEO 的 Crawling、Indexing 和 Technical Structure 仍然是基础。
所以至少要检查:
text
robots.txt
Crawler Access
HTTP Status
Canonical
Index
Sitemap
Internal Link
JavaScript Rendering
SSR / SSG
Page Speed
Structured Data
Duplicate Content
对于 ChatGPT Search,OpenAI 官方也明确说明:
如果希望网页能够出现在 ChatGPT Search 的摘要和 Citation 中,需要允许 OAI-SearchBot 访问。
而且:
text
OAI-SearchBot
和:
text
GPTBot
用途并不相同。
这意味着企业完全可以根据自己的策略分别控制:
text
搜索发现
和
模型训练
这一点对企业网站尤其重要。
Scrunch 甚至专门把 Site Audit 拆成:
text
Access Control
Content Delivery
Content Quality
并进一步监控 AI Bot Traffic,看哪些 AI Crawler 真正在访问哪些页面。
所以真正成熟的 Technical GEO 应该进一步接入:
text
CDN Log
Nginx Log
WAF Log
然后统计:
text
Googlebot
OAI-SearchBot
Perplexity Bot
其他 AI Agent
究竟访问了:
text
哪些页面
访问多少次
状态码是多少
有没有被 WAF 拦截
有没有因为 JS 获取不到正文
这才是真正的:
AI Crawler Observability。
六、第六步:Content GEO,核心不是"AI 文风",而是信息价值
解决完 Retrieval 问题以后,才轮到内容本身。
这里也是目前 GEO 最容易被做成玄学的地方。
网上经常可以看到:
text
多加 FAQ
多写数字
每 300 字切一次
多引用权威网站
写得更像百科
增加 llms.txt
然后包装成:
GEO 最佳实践。
但目前至少 Google 已经明确表示:
不需要为了 Google 的生成式搜索专门创建 llms.txt、特殊 AI Markup 或所谓 AI Chunking。Google 更强调的是传统 Technical SEO,以及独特、有价值、非同质化的内容。
所以真正值得优化的是四件事情:
text
Relevance
这个页面是不是真的回答了问题?
↓
Information Gain
有没有别人没有的信息?
↓
Evidence
重要结论有没有证据?
↓
Extractability
信息是不是容易准确理解和提取?
例如这句话:
Reranker 可以明显提高 RAG 的准确率。
几乎没有什么信息价值。
但是如果写成:
text
测试规模:
120 万 Chunk
Embedding:
BGE-M3
Retriever:
Milvus
TopK:
30
Reranker:
BGE-Reranker
Without Rerank:
Recall@5 = 72.4%
With Rerank:
Recall@5 = 84.1%
代价:
P95 Latency
280ms → 510ms
然后再告诉读者:
text
为什么提升?
哪些 Query 提升最大?
哪些 Query 没提升?
为什么最终仍然上线?
测试数据有什么限制?
这篇内容就拥有了:
Information Gain
因为 AI 可以自己生成:
什么是 Reranker。
但是 AI 不知道:
你的生产环境中 Reranker 到底发生了什么。
Google 当前针对 Generative AI Search 也明确强调 Unique、Expert-led、Non-commodity Content,而不是简单批量生成已有信息的重新组织版。
因此 GEO 时代技术内容真正应该增加的是:
text
真实数据
Benchmark
源码
架构图
实验
失败案例
生产经验
第一手观察
而不是简单增加字数。
七、第七步:不要忽略 Query Fan-out
GEO 还有一个和传统 SEO 非常不同的地方:
AI 不一定拿用户原问题直接 Search。
例如用户问:
最好的企业 RAG 平台是什么?
后台可能进一步生成:
text
enterprise RAG platforms
secure enterprise RAG
RAG access control
RAG platform comparison
RAG deployment options
best RAG software 2026
这就是:
Query Fan-out
Google 已经公开说明 AI Search 中会使用 Query Fan-out,通过多个相关 Query 并行检索更多信息。
Elmo 现在也已经开始直接展示:
text
Prompt
↓
AI 实际展开了哪些 Search Query
甚至分析:
text
AI 增加了哪些词
删除了哪些词
哪些 Fan-out Query 你没有覆盖
这意味着 GEO 内容策略不能只围绕:
text
Best RAG Platform
而应该继续覆盖:
text
Security
Pricing
Deployment
Access Control
Benchmark
Comparison
Integration
Review
所以 GEO 的内容结构最终会越来越像:
text
Topic
↓
Question Graph
↓
Fan-out Query
↓
Knowledge Network
这其实比传统 Keyword Expansion 更接近真实的 AI Retrieval。
八、第八步:修改以后一定要重新跑 Benchmark
这是整个 GEO 最重要,也最容易被忽视的一步。
很多所谓 GEO 服务是:
text
扫描网站
↓
给你 73 分
↓
AI 重写文章
↓
发布
↓
结束
但这不叫真正的优化。
因为:
你根本不知道修改有没有效果。
正确方式应该像做模型 Evaluation:
text
Baseline
↓
提出 Hypothesis
↓
修改
↓
重新执行 Prompt Dataset
↓
比较 Before / After
比如发现:
text
Prompt Cluster:
Agent Evaluation
Baseline Visibility:
18%
Citation Rate:
6%
然后你做了:
text
新增 Benchmark
补充 Agent Eval 方法论
增加 GitHub Example
完善 Structured Data
在几个高 Citation Source 获得真实 Mention
4 周后重新跑:
text
Visibility:
18% → 29%
Citation:
6% → 13%
这才说明:
修改可能有效。
如果:
text
18% → 17%
那就不能因为文章"看起来更 GEO"而自我安慰。
应该:
text
分析
↓
Rollback / 调整
↓
继续 Experiment
最终形成:
text
Experiment 001
Experiment 002
Experiment 003
...
然后逐渐得到:
什么策略对我的行业、我的网站、我的目标 Engine 真正有效。
这其实就是 GEO 最应该具备的科学性。
九、最终,GEO 应该形成这样一套系统
把前面的东西放在一起,一个完整 GEO Platform 可以设计成:
text
GEO Platform
│
Prompt Dataset
│
▼
Multi-Engine Runner
│
┌─────────────┼─────────────┐
│ │ │
ChatGPT Gemini Perplexity
│ │ │
└─────────────┼─────────────┘
▼
Response Store
│
▼
Analysis Engine
│
┌──────────────┼──────────────┐
│ │ │
Mention Citation Fan-out
│ │ │
└──────────────┼──────────────┘
▼
Competitor Graph
│
▼
Gap Analysis
│
┌───────────┴───────────┐
│ │
Owned Website External Source
│ │
Technical / Content PR / UGC / Review
│ │
└───────────┬───────────┘
▼
Experiment
│
▼
Re-run
│
▼
Before / After
这时候 GEO 就不再是一套"内容优化技巧"。
而变成了:
一套围绕 AI Search 的可观测、分析、优化和实验系统。
十、最后总结:真正做 GEO,只需要记住这七步
如果把整篇文章压缩成一套可以直接执行的方法,就是:
text
1. Prompt Research
用户真正会问什么?
↓
2. Baseline
AI 现在怎么回答?
↓
3. Citation Intelligence
AI 为什么引用这些 Source?
↓
4. Gap Analysis
为什么竞争对手有,我没有?
↓
5. Optimization
Technical + Content + Off-site
↓
6. Experiment
修改之后重新跑 Dataset
↓
7. Measurement
Visibility / Citation / SOV / Traffic / Revenue
最终形成一个循环:
text
Research
↓
Measure
↓
Analyze
↓
Optimize
↓
Evaluate
↓
Learn
↓
Repeat
这才是我认为目前最合理的 GEO 方法论。
写在最后
如果一定要用一句话解释"GEO 到底怎么做",我会说:
不要想办法让 AI"喜欢"你的文章,而是想办法让你的信息,在 AI 的 Retrieval、Context、Generation 和 Citation 链路里具备更高竞争力。
这两种思路差别非常大。
前者容易走向:
text
关键词
FAQ
Prompt Trick
llms.txt
固定模板
后者则会走向:
text
Prompt Dataset
AI Search Observability
Citation Graph
Source Gap
Information Gain
Entity Authority
Experiment
Evaluation
而真正有长期价值的 GEO,一定是后者。
SEO 时代,我们优化的是:
Page Ranking。
GEO 时代,我们正在开始优化:
Information Visibility。
所以真正需要建设的也不再只是一篇"SEO 文章",而是一整套:
网站 + 内容 + Entity + 外部信源 + AI Search 数据 + Evaluation System。
这才是 GEO 真正开始变得有技术含量的地方。
参考资料
-
Google Search Central:2026 年发布针对 AI Overviews、AI Mode 等生成式搜索功能的官方优化指南,强调传统 SEO、可抓取性和独特内容仍然是基础。
-
Microsoft Bing Webmaster Tools:2026 年推出 AI Performance,可以查看 Total Citations、Grounding Queries、Page-level Citation 等 GEO 指标。
-
OpenAI Publishers and Developers FAQ:介绍 OAI-SearchBot、ChatGPT Search 可发现性及 Citation 相关控制方式。
-
Profound Answer Engine Insights:围绕 Prompt Tracking、Visibility、Citation 和 Share of Voice 建立 AI Search Monitoring。
-
Peec AI:将 Brand Visibility 与 Source Visibility 分开,并基于 Citation Source 做 Gap Analysis。
-
Elmo:开源 AI Visibility / GEO Monitoring 平台,支持多 Answer Engine 的 Mention、Citation 和竞品监测。
-
Gego:开源 GEO Tracker,提供 Multi-LLM Prompt Scheduling、Citation Tracking、Brand Tracking 和 Analytics。