42个百分点的“排名红利”是假的:一篇因果审计论文,把 AI 引用率的测量方法掀了


大家好,我是Neo。

如果你在做 GEO,你大概见过这类报表截图:某个平台把“AI 引用的位置”画成一条漂亮的下降曲线——排在第一的结果引用率最高,越靠后越低,配一句“所以要抢首选来源”。

9月14日,arXiv 上挂了一篇论文,标题叫 CITECHOICE: A Causal Audit of How Document Presentation Redistributes Citation Credit in Agentic Search(作者 Sriram Selvam 和 Anneswa Ghosh)。它做的事很简单,但结论对所有人的报表都是坏消息:

那条“位置越高、被引用越多”的曲线,绝大部分不是位置的功劳,而是“搜索引擎本来就把更相关的东西排在前面”。

这篇我把它拆成三层:他们怎么做的、三个结论分别是什么、以及独立站该怎么改自己的评测方法。

论文做的是一件“反常识”的实验

先看这条曲线长什么样。在他们的数据里,一次搜索调用中排在第 1 位被暴露的文档,被引用的概率是 85.1%;排第 5 位的是 42.8%。差 42.3 个百分点。

任何人看到这个数字都会得出“位置很重要”的结论。但论文指出:位置和质量是绑在一起的——搜索引擎把更相关、质量更高的页面排在前面,而且这些问题还是代理自己选的。所以这张图测的其实是“好内容 vs 一般内容”,不是“位置”。

于是他们换了做法:

  1. 冻结真实对话。 让一个带搜索工具的 GPT-5.4 代理回答 130 个日常问题(10 个话题 × 5 种问法,从完整提问到简短的搜索式输入),它必须自己发起网络搜索,每次搜索返回 5 条 Exa 结果。整个过程的消息、结果对象、重试全部归档——最终 129 条对话、346 次搜索调用、1,490 个唯一文档。
  2. 只找“竞争对”,不找“排名”。 点评判一篇文档能不能支撑某个事实点是在不知道排名、标题、域名、答案的情况下做的,而且必须给出逐字引用,改写或转述一律降级为“不清楚”。1,465 篇被审的文档里,1,115 篇(76.1%)具备答案支撑。然后挑出这样的“竞争对”:同一次搜索调用里、两篇都能独立支撑同一个事实点——也就是“引用哪一篇都算对”的情况。这种候选对至少 1,894 个,最后冻结 113 对,还有一位人工盲审确认其中 103 对(91.2%)确实在讲同一个命题。
  3. 哈希校验的回放,一次只改一个变量。 只改两件事之一:把两篇文档在数组里的顺序对调,或者把目标文档换成同样事实、不同排版的版本(散文段落 vs 标题+短段落+列表/表格)。其他所有模型可见的字段逐字节保持不变,只有最终答案重新生成。每个“竞争对”跑 4 个格子(顺序 × 排版),一共 452 次试验,0 次完整性校验失败。

这套设计的价值在于:它把“这篇被引用”从“内容对错”变成了“信用分配”。 两篇都能支撑同一个事实,AI 引用谁,是一次纯粹的分账决定。

发现一:观察到的位置差距,是控制后效应的 5 倍以上

口径 结果 统计判断
观察性差距(第1位 vs 第5位) 85.1% → 42.8%,42.3 个百分点 描述性,混杂了相关性和质量
控制后的顺序效应(主回放) +7.9 个百分点(95% CI [+1.1, +14.9]) 多重校正后 Holm p = 0.350,不显著
留出确认(另 56 对,只换顺序) 0.0 个百分点(95% CI [−5.4, +5.4]) 点估计精确为零

论文的措辞很克制:消息位置在某些冻结对话里确实会移动归因,尤其是在“位移幅度很大”的情况下;但从观察性梯度反推出来的平均位置效应,不可靠。

翻译成给独立站的话:你在报表上看到的那条“位置优势曲线”,不能用来指导决策。 因为它把“内容质量”和“检索器排序”的功劳,全记在了“位置”这一个变量上。

发现二:唯一通过统计校正的效应,是“排版让信用集中”

这才是这篇论文对内容团队最有用的部分。

效应 大小 95% CI 显著性
目标文档的引用标记数量(结构化 vs 散文) +0.50 个/答案 [+0.20, +0.84] Holm p = 0.033(唯一通过校正的次要结果)
目标文档是否至少被引用一次(预注册主假设) +4.5 个百分点 [−1.4, +10.4] p = 0.168,不显著
竞争对手被引用的变化 −0.02 个 [−0.28, +0.24] 基本没动
答案的总引用预算 −0.49 个 跨零 没变(没有“总量膨胀”)
新增信用中落在双方共有证据上的比例 48.6%(+0.25 个,p = 0.023) — 事后审计

三个细节必须说清楚,否则很容易被误读成“加个列表就能涨引用”:

第一,被改变的只有“信用分配”,不是“入场资格”。 排版没能显著提高“目标页面被引用”的概率(+4.5 个百分点,置信区间跨零)。它提高的是“当这个页面加入引用列表之后,它在一段共有证据上拿到多少次署名”。而且答案的总引用数没增加,竞争对手也没减少——这不是把蛋糕做大,是把同一块蛋糕上的名字换了一个。

第二,约一半的新增信用,落在“两篇文档都支持的那条证据”上。 也就是说,结构化帮助的不是“让 AI 多讲你的独家内容”,而是“在一段别人也有的证据上,让署名落到你这边”。

第三,一个严苛的消融实验立刻打了折扣。 研究者额外做了一个“逐字不改、只把句子改成一行一条的列表”的机械重排实验:全样本上是 +6.7 个百分点(p = 0.028),但在用于重复性检验的 30 个家族上,第一次是 −1.7、重跑一次是 −8.3,平均 −5.0 个百分点(p = 0.22)。

结论:没有稳定的“列表机制”。 论文自己给的定性是——可见呈现可以重新分配信用,但通路依赖具体对话,不是一个可以照抄的配方。

发现三:AI 引用率这个指标,有一个可测量的“噪声地板”

这是我最希望所有做 GEO 报表的人都读的一页。

研究者把 120 个单元重新生成了一遍,输入完全不变:

  • 目标页面“是否被引用”这个二值判断,一致率只有 85.0%——大约每 7 次里有 1 次会翻转;
  • 精确的被引用页面集合一致率 78.3%;
  • 精确的引用次数一致率只有 61.7%;
  • 用矩量法分解后,单次生成里约 45% 的家族效应方差来自解码随机性;
  • 30 个家族里,家族效应完全一致的只有 17 个。

论文很直白地写道:只报告一次生成的引用研究,继承的是一个可量化的噪声下限,而不是“未说明的随机性”。 重复跑 k 次,可以把噪声分量压到约 1/k。

这和问卷里“同一个问题问两遍”的差别是:这里连问法都一模一样。

论文自己划的边界,比结论更值得收藏

我把它的限制条件列出来,因为任何人拿这篇去说服老板时都需要这些前提:

  • 只有一个检索源(Exa,每次 5 条结果)和一个主要模型(GPT-5.4),结论不能推广到所有 AI 搜索;
  • 它只改了“模型读到的那段文本”,不涉及抓取、检索、排序这些上游环节。也就是说:它证明不了“改网页能把 AI 引用率提上去”,只能说明在文本已经进入模型上下文之后,呈现方式会影响署名分配;
  • 两个排版版本都是由模型改写的(虽然做了七维保真度审核),所以严格说是“改写包”的效应,不是纯粹的“格式”效应;
  • 主假设(是否被引用)本来就统计功效不足——这个设计只能可靠检测 8.5 个百分点以上的效应,所以 +4.5 是“未解决”,不是“证明无效”;
  • 跨模型验证(换成 Grok 4.3 回放)方向是正的,但首次回答只有 44.7% 符合引用格式契约,修复后 +5.6 个百分点——只能算方向性支持,不是量级复制。

作者自己在讨论部分写下了全文最重要的一句话:

“这是一个归因敏感性警告,不是优化战术(This is an attribution-sensitivity warning, not an optimization tactic)。”

顺手交叉验证:另外两个“看起来很有说服力”的结论

论文还顺手点了一下行业里的两个流行结论,这也符合它自己的方法论:

  • 同一提示词重复跑,结果有多不稳定? SparkToro 在 1 月的实验发现,给 ChatGPT 和 Google AI Overviews 同一段重复提示,它们给出完全相同的品牌列表的概率不到 1%。
  • JSON-LD 到底有没有用? Ahrefs 5 月的报告说,被 AI 引用的页面含 JSON-LD 结构的概率大约是其他页面的 3 倍。但报告没有(也无法)证明“加 schema 会增加引用”——这是相关性,不是因果。这跟本篇论文做的事正好互补:一个相关性,只有在你把那个变量单独改一次之后,才知道它是不是因果。

Neo的解读:这两条放在一起,意思不是“schema 没用”、“结构化没用”,而是——你现在看到的绝大多数 GEO 数字,都还没有通过“控制变量”这一关。行业目前处在测量方法远落后于商业承诺的阶段。

那独立站的实操该怎么改

不用重做报表,改六个地方就够:

1. 每格至少跑 3 次,先看波动带。 有了“每 7 次翻转 1 次”这个基准,单次结果没有解释权。一个品牌在一个 prompt 上“丢了引用”,在重复采样之前不该进汇报。

2. 汇报时换一个问法。 别写“我们的 AI 引用率从 32% 涨到 41%”,写“三次采样的引用率区间是 X–Y”。前者报的是一个噪声样本,后者报的是你能负责的结论。

3. 不要为“位置”花钱。 位置是 AI 检索器的内部排序,你控制不了;它跟你的内容质量高度共线,所以“拿到首位”也大概率只是“你内容相关性好”的回声。真正能控制的是可抽取性(内容能不能被干净地读出来)和证据密度(一段话里有多少可被独立引用的事实)。

4. 结构化的正确目标:不是“被列进引用”,而是“在共有证据上拿到署名”。 这是本篇论文最可操作的推论。同一段行业共识,用标题+要点+表格把它写清楚、把数据摆出来,你不一定能让 AI 多提你一次,但更可能让署名落到你这一份上。

5. 做小而可对照的 A/B。 要改就一次只改一处(例如只把其中一段改成结构化),跑多次,看方向是否稳定,而不是上线十项改动后看总曲线。这跟论文的做法一致:先固定其余全部变量。

6. 建立“月度重复采样表”。 把你最关心的 20–30 个 prompt、3 个引擎、每个 prompt 3 次采样固定下来。这张表的价值不在某一次的分数,而在于当“变化”超过波动带时,你能立刻认出它。

最后

这篇论文没有给任何“速赢战术”,它给的是一把校准尺:42.3 个百分点的排名红利,控制变量后归零;唯一站得住的效应是排版带来的信用集中(+0.5 个引用标记);而任何单次生成的引用判断,都有 15% 的翻转率。

对独立站来说,好消息是:你控制不了 AI 的排序,但“把内容写清楚、把事实写实、让爬虫能干净地读到”这三件事全部在你手里。 而按这篇论文,其中至少有“信用集中”这一项,是能带来正向变化的。

坏消息是:如果照旧按单次截图上的红绿格子做决策,你大概会一直在优化一个不存在的变量。