谷歌DeepMind想用一个模型直接「吐出排名」:自回归排序ARR到底改了什么,独立站该怎么看


大家好,我是Neo。

前几天Search Engine Journal报道了一篇Google的研究:DeepMind的研究者提出用一种叫**自回归排序(Autoregressive Ranking,ARR)**的方法,取代今天搜索引擎后端“召回+精排”的两阶段架构——让一个大模型直接“写”出排名列表。

这类论文平时没什么人认真看。但我觉得这篇值得花点时间,因为它是那种“今天不影响你、但会决定三年后你还懂不懂SEO”的东西。技术细节我不打算堆给你,只讲清楚三件事:今天搜索引擎的两层结构是什么、ARR想改成什么、以及它的理论优势为什么会让做长尾内容的人该关心。

顺带一个有意思的细节:这篇论文早在2026年1月9日就挂上了arXiv(编号2601.05588),2月更新到v4,还是ICML 2026的成果,但直到9月被SEJ写出来,才在SEO圈子里传开。信息从学术界传到营销圈,通常滞后6–8个月——这个时差本身就是一种优势,愿意提前蹲守的人能早半年调整方向。

一、今天搜索引擎的“两层楼”是怎么盖的

主流的信息检索系统是把排序拆成两阶段的,每一阶段用一种不同性格的模型:

架构 干什么 优点 硬伤
双塔 Dual Encoder (DE) 把query和文档各自压成一个稠密向量,用近似最近邻(ANN)搜索快速捞出候选 快、便宜,能扛十亿级语料 表达力有上限——query和文档的所有交互被压成了一个点积
交叉编码器 Cross Encoder (CE) 把query和文档拼在一起送进模型,逐对打分 准,排序精细 太贵,没法在全量语料上跑
自回归排序 ARR(论文提案) 让LLM一个token一个token地生成文档ID(docID),用beam search得出概率最高的文档序列 理论上兼具CE的表达力和可接受的成本,还能省掉独立的ANN索引 仍是研究阶段,工程上怎么上产线还是空白

所以工业界的标准做法是:DE负责召回候选,CE负责给候选精排。 便宜的干粗活,贵的干细活。

这套架构有一个隐含的天花板,而且论文把它数学化地说清楚了: 如果要让双塔有能力表达k篇文档的任意一种排序,它的向量维度必须随k线性增长(论文的表述是 n = Ω(k))。语料越大,双塔越吃力。这是结构性的,不是调参能解决的。

二、ARR想干的事:把“打分”换成“生成”

ARR的思路很激进:把文档ID当成token,让LLM依次“写”出docID,用beam search取概率最高的那条文档序列——这个序列本身就是排序结果。

它有三个诱人的性质:

  1. 一次搞定召回和排序,不再需要单独的ANN索引。
  2. 表达力理论上比双塔强: 论文证明,只要docID的词嵌入子矩阵满足满秩条件,一个隐藏层维度恒定的ARR就能实现任意排序——不受语料规模限制。这是整篇论文最硬的一块理论基础。
  3. **排序从“逐篇打分再排”变成“生成一个列表”。**用研究者的话说,是想“弥合双塔与交叉编码器之间的差距”:拿到CE级别的表达力,却不承担CE逐篇打分的成本。

三、怎么训练:SToICaL干了两件事

光有架构不够,得让模型学会“排序”这件事。研究者设计了一个训练损失叫SToICaL(Simple Token-Item Calibrated Loss),核心是两招:

  • 按名次加权(item-level reweighting): 应该排在前面、确实排在前面的文档,给更大权重;排在后面的给小权重。
  • 前缀树边际化(prefix-tree marginalization): 把监督信号沿着docID的前缀树铺到每一个生成步上,而不是只在最后一个token上给一个非黑即白的目标。模型因此能知道“往哪个方向生成才算排在前面”,而不是死记一个ID。

四、实验结果:好消息,和一个必须说的坏消息

研究者在两组数据集上做了测试:WordNet(词义关系)和ESCI(亚马逊购物查询集)。结论可以概括成三句话:

  • 训练方法有效: 在他们的购物搜索测试里,加了前缀树目标的版本把nDCG提升约2.0,R@5提升约23.5,明显好于普通的下一token预测。
  • 能压住“不该出现的结果”: 论文说他们的排序感知训练“大幅减少”了无关文档排到相关文档前面的情况。
  • 对标成熟架构: 在WordNet对比里,ARR的表现与交叉编码器接近,明显优于双塔。

然后是那个必须说的坏消息:在购物搜索的某个实验配置里,ARR在“把最相关的那一条放在第一位”(R@1)这个指标上反而变差了——尽管整体排序质量是提升的。

这个退步很值得琢磨。它说明“整体排序更好”和“第一名更准”不是一回事。 而现实中,第一名的商业价值是有溢价的:用户的注意力、点击、品牌记忆,几乎都集中在那一条上。研究者的说法是这块“需要进一步研究”。

五、对独立站意味着什么:别急着焦虑,也别当没看见

1. 短期(1–2年)不要重排你的优先级。 Google的排序产线是全公司最贵的资产之一,ARR目前只是论文级验证,而且它有个硬条件:docID要能被模型稳定生成——这意味着语料侧要做大量的工程改造。它不会明天替换掉现有系统。

2. 但它指向的方向非常明确:排序从“特征打分”走向“生成”。 如果未来的排序真的是“生成一个列表”,那模型对页面的判断就更依赖它能不能整体理解这个页面在讲什么——而不是你塞了多少个词。

3. 我现在会做三件事,每件独立站都能落地:

  • 继续做实体清晰化。 生成式排序依赖docID/语义标识来定位文档。实体混乱、指代不清、页面主题漂移的站,最先被跳过的可能不是“排名低”,而是根本没被生成进那张列表。
  • 警惕“语义指纹重复”的批量页。 双塔时代,参数略微不同的产品页还能各自占位;生成式排序下,一批语义几乎相同的页面很可能被模型当成同一个东西,整批只留一条——程序化生成的页面要格外小心。
  • 别把“能进候选池”当成成绩。 R@1退步这件事提醒我们:召回能力变强、排序表达力变强,不等于你的“第一名”更稳。候选池更大,只是门槛;排名前几位,才决定收入。

4. 关注什么信号: 接下来一年,我最关注的不是“Google是否全面采用ARR”,而是它会不会先在某个垂直落地。ESCI本身就是购物查询数据集——如果要做A/B测试,购物是最自然的试验田。做电商独立站的同行,这个信号优先级最高。

Neo的解读

我们这一代SEO的所有知识,都是建立在“两阶段”这个前提上的:关键词匹配、内链权重流动、页面打分、排名位置——本质上都是“打分模型”的产物。而ARR指向的世界里,排序是一个生成过程。

我觉得可以打个比方:过去的排序像考试打分,你的卷子被一题一题评分,多写几行、多塞几个关键词,也许能多拿0.1分;而生成式排序像面试口述——考官心里有一张候选名单,然后直接说出他要的那几个人。在打分制里,“分数”是你的成绩;在生成制里,你能不能进入那张名单,比你能打多少分重要得多。

这也是为什么我一直在写实体、写品牌一致性、写内容的结构化——它们不是玄学,它们是让模型“能指名道姓地想起你”的工程手段。ARR如果真落地,这些功夫会从“加分项”变成“入场券”。

最后一个更冷静的判断:别把这篇论文当成SEO的葬礼预告。 从1998年到现在,Google从PageRank一路走到RankBrain、BERT、MUM、AI Overviews,每一次架构级的变化都宣布过一次“SEO已死”,而每次活下来的都是同一批人:那些愿意搞清楚底层机制、而不是背操作手册的人。 ARR只是又给出了一个新的“底层”。你不需要懂它的数学,但你需要知道——你正在优化的那个东西,它的定义变了。