AI可见性报告里那个红格子,可能根本不是内容问题:三个新研究告诉你,“品牌没被AI提到”这句话什么也没解释


大家好,我是Neo。

如果你正在给独立站做GEO(生成式引擎优化),你每个月大概都会看到这么一张表:20个问题,每个问题底下标注着你的品牌有没有出现在AI的回答里。有的格子是绿的,有的格子是红的。

然后真正的问题来了:红格子到底该怎么解释?

内容不够专业?外链不够硬?还是模型压根就没记住我这个牌子?

大多数时候,这个答案取决于会议室里谁的嗓门大。做内容的说要多写文章,做外链的说要拿权威背书,做品牌的说要投PR。这三张处方花的钱完全不一样,但它们用的是同一个红格子当证据。

9月16日,Search Engine Journal 上 Pedro Dias 发了一篇文章,标题叫《It Was There A Minute Ago》(一分钟前还在呢)。这人很有来头——前 Google 搜索质量团队成员,现在做独立顾问,长期写“AI可见性”这个话题,而且是我见过的少数几个敢对自己行业开炮的人。

他这篇文章表面上是在读论文,实际上是在说一件事:从“品牌没被提到”推到“你的内容不足”,中间缺的不是一点证据,是整整一层证据。

我把他的论证重新组织了一遍,加上我自己的理解,讲清楚这件事对独立站意味着什么。

红格子至少有四种“病因”,而它们要的药完全不同

先把话说透。当你的品牌在某条提问下没有出现,AI可见性的计数器只能告诉你“结果”,它没有能力告诉你“原因”。而可能的原因至少有四种:

可能的原因 通俗说法 对应处方 花钱方向
编码失败 模型根本不知道有你 内容、可被抓取的结构化信息、权威信号 内容团队 + 技术SEO
召回失败 模型知道,但这次想不起来 换提问角度、增加稳定的关联信号(实体、共现) 实体SEO / 品牌建设
来源冲突 检索回来的内容里有错误或竞品信息压制了你 治理外部信息源、修正错误描述 品牌监控 + PR
提问方式 你测的那句话本来就不该出现品牌名 换一组更贴近真实买家的问题 不需要花钱,改方法论

四种原因,四种处方。而一张只有“有/没有”的红绿表格,对这四种情况完全没有分辨能力。

SEJ 那篇文章最大的价值,是它拿了三篇论文来具体说明,为什么这个分辨这么难——难到什么程度?难到连把模型拆开都不一定说得清。

研究一:模型明明答对了,工具一说错它就跟着错

第一篇叫 MemToC(记忆-工具冲突基准测试)。它测的是一个特别现实的场景:AI模型自己的知识,和它调用工具(检索)拿回来的信息打架的时候,它听谁的。

实验设计很干净:

  1. 先不给工具,让模型凭自己的知识回答一批事实性问题;
  2. 筛选出模型答对了的那些题;
  3. 然后故意让工具返回一个错误答案,看模型会不会改口。

结果不太好听:四个指令微调模型,正确答案的保留率只有 6.5% 到 17.1%。

换个方向看,同一批模型在工具给出正确答案时,有 86.0%–93.1% 会照做——这说明它们不是不信任工具,而是无条件偏向工具。最能说明问题的是第三种情况:当模型自己的答案和工具返回都是错的时,它们仍然有 78.4%–86.0% 会把工具的错误答案复述出来。

还有一条细节更值得记:研究者另外抽了120条“工具返回错误”的回答做人工标注,没有一条明确承认了前后矛盾。模型不会说“等等,这和我刚才说的不一样”,它只是安静地把错的答案讲了出来。

Neo的解读:这项研究的样本是5个开源、7–9B参数的小模型,作者自己也强调,这些百分比不能直接套到 ChatGPT 搜索或 Google AI Overviews 上。所以不要拿“6.5%”去吓唬人。

但它给独立站的启示是结构性的:AI回答里真正在“说话”的,往往是你被检索到的那一小段内容。 模型自己记住了什么,在检索内容面前权重并不高。这反过来解释了很多老板的困惑——“我的品牌行业里做了十年,为什么AI不认?”因为AI在这次回答里认的不是你的十年,是它刚刚抓到的那三行字。

这也意味着:别人怎么写你,和你怎么写自己,权重一样高,甚至更高。 这几周我一直在讲品牌信息冲突治理,原因就在这。

研究二:95%的事实模型都“存下来了”,但取不取得出来是另一回事

第二篇是 Google Research 和以色列理工合作的 《Empty Shelves or Lost Keys?》(空货架,还是丢了钥匙?),已经发在 ICML 2026,arXiv 编号 2602.14080。

它问了一个特别朴素的问题:模型答错一个事实的时候,到底是没学过(空货架),还是学过但取不出来(钥匙丢了)?

为了分开这两种情况,他们建了一个叫 WikiProfile 的基准,2150条事实,每条配10个问题,用“强语境复现”来判定事实有没有被“编码”进去,再用“四种变体全部答对”来判定是否“可靠可取”。跑了13个模型、400万次回答之后,结论是:

  • 编码几乎饱和:GPT-5 和 Gemini-3 在编码探测上的通过率是 95%–98%,前沿模型基本把事实都存进去了;
  • 召回才是瓶颈:大量以前被归因为“知识缺失”的错误,其实是“知识取不出来”;
  • 失败是系统性的:长尾事实和反向提问尤其容易翻车;
  • “思考”(thinking)能救回来相当一部分,这暗示未来的提升空间可能不在于继续堆规模,而在于让模型更会用已经存下来的东西。

Neo的解读:这里有一个我们必须警惕的翻译错误。当你的品牌在一个问题上“没被提到”,很多GEO服务商的口径是“模型不知道你”。但这篇论文说明,在维度上,“不知道”和“知道但没取出来”是两个不同的病。

更要命的是失败集中的那两个位置——长尾事实和反向提问。

想想买家是怎么问的。他不会问“Neo的独立站SEO咨询服务好不好”(正向、品牌词,容易命中)。他会问“中国有哪些做独立站SEO靠谱的顾问”(反向提问 + 长尾)。这两类恰好是模型最容易失手的地方。

所以你的品牌在“品牌词提问”里表现好,完全不能证明你在“品类词提问”里也表现好。这两种测出来的根本不是同一件事。

研究三:就算把模型拆开,也证明不了“它没学会”

第三篇是9月10日挂上 arXiv 的 《From Parameters to Answers》(从参数到回答),编号 2609.11859,中文作者是来自中国科学技术大学的研究者。

这篇更硬核,直接对模型内部下手,但思路可以用大白话讲清楚:他们研究模型在回答“某国属于哪个洲”这类问题时,模型内部的隐藏状态里同时存在两种东西——

  • 内容(content):真正承载答案知识的那部分;
  • 路由(routing):控制后续层去哪里找知识的那部分。

然后他们做了两件事:一是改动内部信号看答案变不变;二是“重定向”,让模型去找一个错误的答案。结论很有意思:

  • 干预路由信号,在较早的层通常能改变输出,但到了较后的层就越来越无效——因为模型在后面的层里越来越坚持正确答案;
  • 而干预承载答案的内容,始终都有效。

研究者自己也承认:结论取决于你测量的是哪个信号、以及你用什么方式改它。这套方法给不出一个“所有模型都这样取知识”的通用图纸。

Neo的解读:这篇论文真正打脸的对象,是**“模型召回失败”这个诊断话术本身**。

因为它说明:即便你有权限打开模型、看内部激活值,你仍然要小心翼翼地区分“我能观测到什么”和“我能证明什么影响了答案”。那你凭什么看着一份外部输出的红绿表格,就敢在PPT上写下“这是模型召回失败”?

多了几个技术词汇,并不能凭空补上那个缺失的实验。

Neo的解读:把三篇放一起,我看到的是“诊断通胀”

三篇论文测的其实是三件不同的事:第一篇测模型对冲突证据的反应,第二篇比较强语境复现和可靠作答的差距,第三篇干预内部激活。作者自己也提醒:把它们拼成一个漂亮的漏斗图,会造出一个三篇论文都没有测过的模型。

但它们放一起,确实指出了一个行业现象:我们在没有诊断的情况下,开始大量地“开处方”。

我把它叫做诊断通胀——症状(一个红格子)是有限的,但解释它的说法越来越高级:内容不足、权威不够、召回失败、训练数据没覆盖、实体不清晰……每多一个说法,就多一个可以卖给你的服务。

Pedro Dias 在文章里讲了一个我觉得特别妙的自嘲案例。两个月前他在 LinkedIn 上宣布自己是 “世界上最著名的AI可见性专家”。这个头衔是他自己封的,纯属开玩笑——结果直到现在,搜索 worlds most renowned ai visibility expert 时,他那条原始帖子仍然会被 Google 的 AI Overviews 引用。

他把两个关键点摆出来了:

  1. AI Overviews 甚至在回答里明确说明“这是他给自己起的玩笑头衔”,但它照样会念出他的名字、引用他的帖子;
  2. 一条只统计“品牌名有没有出现”的计数器,会把这条回答记成一个漂亮的正面案例。

他的观点是:你把一个红格子改成绿格子,就可以收工了吗?不,你得去读那句话到底说了什么。

Neo的解读:这个案例对做品牌的人是可以拿来玩的(搜索一下品类关键词加上“最知名的”之类的自我描述,看AI会不会上钩),但对做汇报的人是个警示——可见性指标是会骗人的,而且骗法非常低级。

那到底该怎么诊断?给独立站的实操清单

我不打算只吐槽。下面是我现在给自己和客户做AI可见性复盘时用的六条规矩,你可以直接搬走。

1. 存原文,不要只存“有没有”

只记录“品牌是否出现”是浪费一次采样。把AI回答的原文完整存下来,包括它引用了谁、怎么描述你、有没有把你说成别的东西。一次采样能回答的问题,远比一个布尔值多。

2. 把“品牌词提问”和“品类词提问”分开统计

这两类的问题难度、失败机制完全不同(见研究二)。混在一张表里求平均值,等于把体温和血压算成一个数。

3. 同一问题多次采样,先看波动

“这个月我们出现了12次,上个月15次”——这句话在统计学上可能是噪音。同一句话重复问20次,如果你看到的是11到17之间随机跳,那你根本没有变化需要解释。先确认差异大于日常波动,再谈原因。

4. 看“引用的来源”,而不是只看你的官网

AI答案里的那三行话,往往来自第三方的页面。你要查的是:这次引用的是谁的内容?内容对不对?是谁写的?

如果你发现自己被引用的来源是一个搬运站、一个聚合页、甚至一个把你说错的老页面,那你的问题就不在自家官网上,而在外部信息源治理上。

5. 干预要小而可对照

不要一上来就“全站翻新 + 拿十个外链 + 投一轮PR”,然后归因到某个指标。先挑一个变量,动它,看两周。 论文里的教训很直白:一个正确的答案都可能被一条错误工具返回冲掉,说明这个系统的变量很多,不控制变量就得不到结论。

6. 提方案的时候,说清楚你排除了什么

“内容不足”是一个结论,不是一个起点。如果你建议加内容预算,请多说一句:我凭什么认为这是内容问题,而不是来源冲突或者召回失败?

Pedro Dias 在文末问了这么一句,我觉得每个做GEO的人都可以拿来自查:

如果你要卖我一个解决红格子的方案,你是拿什么证据,判断出我得的到底是哪一种病的?

什么情况下,说“内容不足”才是站得住的

公平地说,内容问题确实存在。下面这几种情况,下“内容不足”这个判断我认为是合理的:

  • 品类词/常识词提问下稳定缺失(不是偶尔掉一次,而是连续几周都在),同时竞品稳定出现;
  • 你的站点在相关主题上确实没有可用内容——AI抓回来的内容里根本没有你的页面;
  • 被引用的第三方内容里描述你的信息是错的、过时的、或者缺失的,而这个错误是可以定位的;
  • 用更接近买家真实问法的长尾问题重测,结果依然一样。

反过来,下面这些情况不足以支撑“内容不足”的结论:

  • 只是这个月比上个月少出现了几次(可能是波动);
  • 只测了品牌词提问(那测的是品牌而不是内容);
  • 你的内容已经在AI答案里被引用,只是没点你的名字(那是引用与署名分离的问题);
  • 唯一证据就是那一张红绿表格。

最后

这篇写下来,我想说的其实不是“别做AI可见性监测”——恰恰相反,我觉得监测必须做。论文里也承认:只要样本定义清楚,计数本身是有意义的,你不需要搞清楚模型内部机制才能统计它有没有提到你。

我想说的是另外一件事:计数是观测,诊断是推理,这两件事之间隔着一整套证据链。

现在的行业状况是,很多人在用观测的成本,卖推理的结论。

作为独立站的老板,你没法要求所有服务商都变成研究者。但你至少可以要求一件事——当有人告诉你“你的品牌没被AI推荐,因为我们内容做得不够”时,让他说清楚这句话是哪来的。

这个要求并不过分。写论文的人都老老实实交代了自己测了什么、没测什么,凭什么商业上的结论可以免检?