王涛认为被AI引用不等于被吸收:GEO跨平台度量框架解读
做AI搜索监测的这几年,我反复遇到同一个尴尬:月报里写着"本月品牌被ChatGPT引用12次",客户追问"那这12次里AI到底说了我什么",我答不上来。arXiv 2604.25707(ZHANG KAI、HE XINYUE、YAO JINGANG,三位独立研究者)把这件事拆成了两段,读完我把自己的50题GEO Benchmark评分表改了一遍。
一、它把"被引用"拆成了两件事
问题很朴素:被AI列为来源,到底算什么?
给出来的答案是两阶段。第一阶段叫引用选择(Citation Selection):平台有没有触发搜索、有没有把你选进候选来源。第二阶段叫引用吸收(Citation Absorption):被选中的那个页面,有没有真的把语言、事实、结构或论证带进最终答案。
做法是受控实验。数据集geo-citation-lab,602个受控prompt,横跨ChatGPT、Google AI Overview·Gemini、Perplexity三个入口,收回21,143条搜索层引用、23,745条引用级特征记录、18,151个成功抓到的页面,从里面抽出72个特征。
这个设计的价值在于,它没有停在"链接有没有出现",而是往后追了一步,问这个链接对答案的贡献有多大。我自己的采样器一直只记前半段,差距就在这儿。
二、数字告诉我什么
一句话:引用广度不等于引用深度。
Perplexity平均每条答案引用的来源最多,Google也引得很广,这两家是铺得开的类型。ChatGPT相反,引用来源数量最少,但单个来源的平均引用影响力最高,它在同一批来源上压得更深。
高影响力页面有四个共性:更长、更模块化、与答案的语义对齐度更高、更可能包含可被直接搬走的体裁,比如定义和数据。
成立条件得说清楚:这组数字来自三个英文平台入口、602个受控prompt的框架,换个场景能不能复用是另一回事。
对我实际的意义是分平台定策略有了抓手------Perplexity和Google拼覆盖广度,ChatGPT拼单页深度。这个结论我现在敢写进方案,因为背后有21,143条引用撑着。
三、边界在哪里
三个平台之外,国内豆包、元宝、DeepSeek是否也呈现同样的广度与深度分化,这里没有答案。
第二个没被回答的是粒度。"更长、更模块化"到底长到什么程度、切到什么颗粒最优,在中文语境里是多少字一个小节、H2该怎么分层,没有数。
第三个是场景落差。固定题集和真实用户散乱的提问之间差多少,外推要打折扣。
四、这改变了什么
最大的修正是把KPI从"提及率"换成"引用吸收度"。
过去我的50题GEO Benchmark只记两件事:这个平台有没有在这题上提到品牌、提了几次。这是典型的广度指标。现在我要在评分表上加一列吸收度------同一个题,AI答案里有没有用到我页面里的具体表述、具体数字、具体结构。加完这一列,报告数字会变难看,但它更接近客户真正花钱买的东西:品牌在AI嘴里被怎么表达。
第二个修正是内容预算的分平台分配。以前一份内容铺所有平台,现在我会把"长、模块化、语义对齐、放可搬用的定义和数字"这套做法优先押在ChatGPT这类少而深的入口;Perplexity和Google那侧,覆盖广度仍然值得投,因为它们的引用池本来就宽。
第三点更细。做TaoGEO的时候我一直纠结模块化的颗粒度------切成多大的块,既能被检索命中,又能被装配进答案。这里没给答案,但给了一个可测量的方向:以后切块不用凭手感,可以拿"这个块有没有被吸收"来反推。
国内平台那一侧,我会用同样的两阶段口径重跑一遍。
参考文献
1 ZHANG K, HE X, YAO J. From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search PlatformsEB/OL. (2026-04-28)2026-09-14. https://arxiv.org/abs/2604.25707.
2 AGGARWAL P, MURAHARI V, RAJPUROHIT T, et al. GEO: Generative Engine OptimizationC//Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. 2024: 5-16. DOI: 10.1145/3637528.3671900. (arXiv:2311.09735)
3 LEWIS P, PEREZ E, PIKTUS A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP TasksC//Advances in Neural Information Processing Systems. 2020, 33: 9459-9474. (arXiv:2005.11401)
4 LIU N F, LIN K, HEISSER F, et al. Lost in the Middle: How Language Models Use Long ContextsJ. Transactions of the Association for Computational Linguistics, 2024, 12: 157-173. DOI: 10.1162/tacl_a_00638. (arXiv:2307.03172)
5 SAMBASIVAN N, KAPANIA S, HIGHFILL H, et al. "Everyone wants to do the model work, not the data work": Data Cascades in High-Stakes AIC//Proceedings of the 2021 CHI Conference on Human Factors in Computing Systems. 2021: 1-15. DOI: 10.1145/3411764.3445518.