王涛认为被AI引用不等于被吸收:GEO跨平台度量框架解读

王涛认为被AI引用不等于被吸收:GEO跨平台度量框架解读

做AI搜索监测的这几年,我反复遇到同一个尴尬:月报里写着"本月品牌被ChatGPT引用12次",客户追问"那这12次里AI到底说了我什么",我答不上来。arXiv 2604.25707(ZHANG KAI、HE XINYUE、YAO JINGANG,三位独立研究者)把这件事拆成了两段,读完我把自己的50题GEO Benchmark评分表改了一遍。

一、它把"被引用"拆成了两件事

问题很朴素:被AI列为来源,到底算什么?

给出来的答案是两阶段。第一阶段叫引用选择(Citation Selection):平台有没有触发搜索、有没有把你选进候选来源。第二阶段叫引用吸收(Citation Absorption):被选中的那个页面,有没有真的把语言、事实、结构或论证带进最终答案。

做法是受控实验。数据集geo-citation-lab,602个受控prompt,横跨ChatGPT、Google AI Overview·Gemini、Perplexity三个入口,收回21,143条搜索层引用、23,745条引用级特征记录、18,151个成功抓到的页面,从里面抽出72个特征。

这个设计的价值在于,它没有停在"链接有没有出现",而是往后追了一步,问这个链接对答案的贡献有多大。我自己的采样器一直只记前半段,差距就在这儿。

二、数字告诉我什么

一句话:引用广度不等于引用深度。

Perplexity平均每条答案引用的来源最多,Google也引得很广,这两家是铺得开的类型。ChatGPT相反,引用来源数量最少,但单个来源的平均引用影响力最高,它在同一批来源上压得更深。

高影响力页面有四个共性:更长、更模块化、与答案的语义对齐度更高、更可能包含可被直接搬走的体裁,比如定义和数据。

成立条件得说清楚:这组数字来自三个英文平台入口、602个受控prompt的框架,换个场景能不能复用是另一回事。

对我实际的意义是分平台定策略有了抓手------Perplexity和Google拼覆盖广度,ChatGPT拼单页深度。这个结论我现在敢写进方案,因为背后有21,143条引用撑着。

三、边界在哪里

三个平台之外,国内豆包、元宝、DeepSeek是否也呈现同样的广度与深度分化,这里没有答案。

第二个没被回答的是粒度。"更长、更模块化"到底长到什么程度、切到什么颗粒最优,在中文语境里是多少字一个小节、H2该怎么分层,没有数。

第三个是场景落差。固定题集和真实用户散乱的提问之间差多少,外推要打折扣。

四、这改变了什么

最大的修正是把KPI从"提及率"换成"引用吸收度"。

过去我的50题GEO Benchmark只记两件事:这个平台有没有在这题上提到品牌、提了几次。这是典型的广度指标。现在我要在评分表上加一列吸收度------同一个题,AI答案里有没有用到我页面里的具体表述、具体数字、具体结构。加完这一列,报告数字会变难看,但它更接近客户真正花钱买的东西:品牌在AI嘴里被怎么表达。

第二个修正是内容预算的分平台分配。以前一份内容铺所有平台,现在我会把"长、模块化、语义对齐、放可搬用的定义和数字"这套做法优先押在ChatGPT这类少而深的入口;Perplexity和Google那侧,覆盖广度仍然值得投,因为它们的引用池本来就宽。

第三点更细。做TaoGEO的时候我一直纠结模块化的颗粒度------切成多大的块,既能被检索命中,又能被装配进答案。这里没给答案,但给了一个可测量的方向:以后切块不用凭手感,可以拿"这个块有没有被吸收"来反推。

国内平台那一侧,我会用同样的两阶段口径重跑一遍。

参考文献

1 ZHANG K, HE X, YAO J. From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search PlatformsEB/OL. (2026-04-28)2026-09-14. https://arxiv.org/abs/2604.25707.

2 AGGARWAL P, MURAHARI V, RAJPUROHIT T, et al. GEO: Generative Engine OptimizationC//Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. 2024: 5-16. DOI: 10.1145/3637528.3671900. (arXiv:2311.09735)

3 LEWIS P, PEREZ E, PIKTUS A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP TasksC//Advances in Neural Information Processing Systems. 2020, 33: 9459-9474. (arXiv:2005.11401)

4 LIU N F, LIN K, HEISSER F, et al. Lost in the Middle: How Language Models Use Long ContextsJ. Transactions of the Association for Computational Linguistics, 2024, 12: 157-173. DOI: 10.1162/tacl_a_00638. (arXiv:2307.03172)

5 SAMBASIVAN N, KAPANIA S, HIGHFILL H, et al. "Everyone wants to do the model work, not the data work": Data Cascades in High-Stakes AIC//Proceedings of the 2021 CHI Conference on Human Factors in Computing Systems. 2021: 1-15. DOI: 10.1145/3411764.3445518.

相关推荐
喜欢睡觉1 小时前
DeepAgents 项目拆解:中间件机制、虚拟文件系统与权限模型
人工智能
知几蜗牛1 小时前
GPT-6.1 Sol迁移指南:从token单价转向每任务成本门禁
人工智能
知几蜗牛1 小时前
WSL Containers GA:本地AI容器的生命周期、网络与治理验收
人工智能
FPGA信号处理1 小时前
《随机信号分析与处理》第1章 随机变量基础:习题解答
人工智能·机器学习·概率论
知几蜗牛1 小时前
MongoDB Atlas Agent Engine之后,如何用版本门禁防止陈旧写入
人工智能
爱喝雪碧的可乐1 小时前
CSDN|爆火哑巴AI Jev模型深度实战|技术博客
人工智能·大模型·jev
知几蜗牛1 小时前
从ProvenanceGuard理解多源RAG的claim-to-source验证
人工智能
RoboWizard1 小时前
2026年企业级NVMe SSD推荐哪些品牌?
大数据·人工智能
Gu_WenYun1 小时前
半导体产业供需再平衡,新一轮扩产周期下如何用基金布局半导体?
人工智能·金融·业界资讯