谷歌研究实锤:AI记住了95%的事实,但主宾顺序一颠倒就答不上来——对独立站实体SEO的启示


大家好,我是Neo。

先问你一个问题:一个 AI 回答不上来某个问题,是因为它没学过,还是因为它想不起来?

以前我们都默认是前者——数据不够嘛。但谷歌 8 月中旬发的一篇研究论文,直接把这个认知掀翻了。

论文标题起得很妙:《空书架还是丢钥匙?召回才是参数化事实性的瓶颈》(Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality)。

核心结论一句话:GPT-5、Gemini-3 这种顶级模型,编码了 95-98% 的事实,却有 26-34% 直接想不起来。 而且有一个发现对做 SEO 的人来说简直是原子弹级别的——主语和宾语的顺序一颠倒,AI 的召回能力就明显下降。

这篇文章我把它拆开揉碎,讲讲研究到底说了什么、对独立站的内容写作意味着什么。

一、研究的核心框架:编码、召回、识别

论文提出了一个“知识画像”(knowledge profiling)框架,把大模型的知识状态分成三个层次:

  • 编码(Encoding):事实有没有存进模型参数里
  • 召回(Recall):没有任何外部提示的情况下,能不能把存进去的事实“想起来”
  • 识别(Recognition):把正确答案混在一堆选项里,模型认不认得出来

基于这个框架,研究者建了一个叫 WikiProfile 的基准:从维基百科提取了 2,150 条真实事实,每条事实配 10 道题(2 道编码测试、4 道知识测试、4 道选择题识别测试),在 13 个模型上跑了约 450 万次回答。

结果非常清晰:

“编码已经饱和,召回却没有。”

Gemini-3-Pro 和 GPT-5 对 95-98% 的事实完成了编码,但仍有 26-34% 的事实无法直接召回;就算开启思考模式(thinking),也还有 11-12% 答不上来。GPT-5.2 的错误中,超过 70% 来自召回失败。

翻译成人话:前沿模型的瓶颈已经不是“知识不够”,而是“知识存在但取不出来”。用论文里的比喻——问题不是书架是空的,而是钥匙丢了。

二、那个对 SEO 意义重大的发现:主宾顺序

研究里最出圈的发现,是倒置诅咒(reversal curse)的重新解读。

先看例子。谷歌的解释文章用了这句话:

“Oasis played their first gig at the Boardwalk club.” (绿洲乐队在 Boardwalk 俱乐部办了首场演出。)

在这句话里,主语实体是 Oasis,宾语实体是 Boardwalk 俱乐部——因为它在原文里先出现,后续出现。

由此定义两种问题:

  • 直接问题(direct question):答案在宾语位置。比如“绿洲乐队在哪里办了首场演出?”→ 答:Boardwalk 俱乐部。
  • 反向问题(reverse question):答案在主语位置。比如“哪支乐队在 Boardwalk 俱乐部办了首场演出?”→ 答:绿洲乐队。

研究发现:当问题把主语/宾语的顺序颠倒过来时,模型的召回能力明显下降。

在开放问答(回忆式生成)里,反向问题一贯比直接问题难;但在多选题验证(识别式)里,反向问题并不比直接问题难,甚至更简单。

这个“分离”现象很关键:如果模型能在干扰项里认出正确答案,却无法在反向提问时直接答出来,说明知识确实存进去了,只是提问方向跟训练时的顺序不一致,导致取不出来。

换句话说:倒置诅咒本质上是一个召回问题,不是知识缺失问题。

还有两个相关发现:

1. 换说法没用,换顺序才有用。 研究者测试了改写问题措辞,发现对召回能力几乎没有影响;真正起决定性作用的,是主宾顺序是否与训练时一致。

2. 长尾事实不是“没学到”,是“想不起来”。 对比低热度和高热度事实后发现:编码率差距很小(长尾事实一样被存进去了),但召回率的差距明显更大。长尾问题被重新定义了——不是模型参数里没有,而是存在里面但很难访问。

三、思考模式(thinking)能救回多少?

研究还测试了“思考”——让模型在给出最终答案前先进行中间推理(包括思维链提示和思考优化的模型)。

结果:

  • 对已编码但无法直接召回的事实,思考能救回 40-65%
  • 对根本没编码的事实,思考只能救回 5-15%

这个差距恰好说明:思考主要起的是**“回忆辅助”作用**——帮模型够到已经存进去的知识,而不是靠复杂推理现场推导答案。

思考模式还显著缩小了两个差距:长尾事实与热门事实的召回差距、反向问题与直接问题的差距。

但思考不是免费的午餐:计算成本高,而且目前没人知道什么时候该触发思考——模型不知道、研究者也不知道。另外,论文明确指出:单纯扩大模型规模不是解决办法。在 Gemma 3 系列里,模型越大编码失败越少,但召回失败依然显著存在,甚至占了剩余错误的大头。

缩放改善的是存储,不是访问。

四、对独立站 SEO 意味着什么?

这部分才是重点。SEJ 的 Roger Montti 在解读文章里给出了一个观点,我深以为然:

直觉上,把主语和宾语实体按照用户最常见提问顺序来排列,可能是对 SEO 有益的。

注意,这不是论文的结论,是合理假设——论文并没有说“常见实体排序会帮助 LLM 选中某个网页”。但从 SEO 的角度看,这个假设的逻辑链条非常顺:

AI 生成的回答是从你的内容里“召回”出来的 → 召回受训练时接触的主宾顺序影响 → 你写内容的顺序,决定了 AI 训练时接触的顺序 → 按用户提问习惯的顺序写事实,能让 AI 更容易把你的内容“想起来”。

落到实操,我给出几个具体建议:

1. 事实句式的“双向覆盖”

写关键事实时,别只写一种方向。

比如你要写“Shopify 支持 TikTok 销售渠道”,除了这句主语在前的写法,还要覆盖用户真正会问的方向——“哪些平台支持 TikTok 销售?”(TikTok 在前)。理想的做法是在同一篇文章里把两个方向都自然写到:

  • Shopify 集成了 TikTok 销售渠道
  • 想在 TikTok 上卖货,可以用 Shopify 等支持 TikTok 渠道的建站平台

这就是论文里“直接问题 + 反向问题”双覆盖的落地版。

2. 标题和首句就点明实体关系

AI 召回和引用最依赖的是标题、首段、小标题下的第一句。把“A 是什么、A 和 B 什么关系”这种实体关系放在最显眼的位置,等于给 AI 的检索提供最顺手的抓手。

3. 用“用户问法”而不是“书面语”组织内容

用户的问法往往把答案放在主语位置(“谁/哪家/哪个……”),而百科式的书面语习惯把答案放宾语位置。写内容时,把用户最常问的那个方向作为主表达方向,别只顺着百科语序写。

4. 长尾事实更要写清楚

研究说长尾事实“存了但取不出来”。对应到内容:冷门但你擅长的事实,恰恰是 AI 最可能从你这里“取”的差异化内容——前提是写清楚。用最简单直接的“A 是 B”句式,把实体关系钉死在首段里,别用绕来绕去的长从句。

五、Neo的解读

1. 这是第一份“表述顺序影响 AI 回答”的论文级证据

过去两年大家都在谈 AEO、GEO、内容结构化,但大多是经验之谈。这篇论文第一次从认知机制层面给出了证据:训练文本里的实体顺序,真实地影响着模型后续的召回表现。 对我们做内容的人来说,这是“怎么写”这件事第一次有了科学依据。

2. 它把“实体 SEO”从玄学变成了物理

实体 SEO 一直被诟病“太虚”——反正就是让 Google 知道你、你的产品、你的关系。这篇研究给了它一个具体的物理机制:主语/宾语顺序。以后写产品介绍、写 FAQ、写对比文,都可以套用一个检查清单:这句话的主语宾语顺序,跟用户问问题的方式一致吗?

3. 别过度解读,但值得立刻行动

要泼三盆冷水:

  • 研究基于 WikiProfile(2,150 条维基百科事实),维基百科的语序风格和商业网站差异很大
  • “按常见顺序排列实体”是研究者的直觉建议,论文没有验证它对网页收录/引用的直接影响
  • 这是对模型召回的研究,模型如何从网页里选择引用来源是另一套机制

但“立刻行动”的理由也成立:双向覆盖、用户问法优先、首段钉死实体关系——这几条成本几乎为零,就算研究结论被推翻,这些写法对正常 SEO 也没有坏处。这就是典型的“下有保底、上不封顶”。

4. 一个更大的信号:AI 内容写作的新方向

这篇论文还暗示了一件事:如果主宾顺序影响召回,那么“AI 友好内容”和“人读起来顺的内容”正在出现微妙的分岔。 未来可能会出现专门针对模型召回优化的写作工具——根据目标关键词的常见问法,自动调整实体出现顺序。先想清楚这个逻辑的人,会先吃到红利。

写在最后

“空书架还是丢钥匙?”——谷歌这篇论文给出的答案是:架子上其实都有书,钥匙才是问题。

对我们做独立站的人来说,这个结论既是警告也是机会:

  • 警告:AI 时代的竞争不是“谁的知识多”,而是“谁的知识能被 AI 取出来”
  • 机会:内容写作的顺序、结构、实体摆放,第一次有了可验证的优化方向

从今天起,写每一段关键事实前,先问自己一句:用户会怎么问这个问题?我按他们的问法写了吗?

我是Neo,我们下篇见。