ChatGPT搜索索引并没有抛弃小网站:最新数据解读独立站的机会


大家好,我是 Neo。

最近跨境独立站圈子里一直弥漫着一股焦虑:“AI 搜索只认大品牌,小网站没戏了”。尤其是上个月,有技术大牛扒了 ChatGPT 的网络请求,发现它的结果里带了一个叫 labrador 的字段,里面全是 Reuters、WSJ、Wikipedia 这类顶级媒体,于是很多人下了结论——ChatGPT 的自家索引就是个“白名单”,小站根本进不去。

但今天我要给大家带来一个好消息。法国 SEO 咨询公司 Resoneo 发布的最新研究直接推翻了这套说法:ChatGPT 的自家搜索索引,同样在服务小网站,而且服务方式和那些签了内容授权的大媒体没有任何区别。

这篇文章,Neo 就带你把这份研究的原始数据、背后的机制,以及对独立站卖家的实际意义,一次性讲透。

先复盘:那场“虚惊”是怎么来的?

事情要从 7 月说起。SEJ 作者 Suganthan Mohanadasan 发了一篇爆款文章《How ChatGPT Actually Picks Sources》,他通过抓取 ChatGPT 浏览器的网络流量(JSON 数据),发现了 ChatGPT 引用来源的秘密。

每个搜索结果都带一个 result_source 字段,取值有四种:

字段值 含义 主要出现的场景
labrador OpenAI 自家索引 新闻、参考类内容
serp 开放网页基础抓取 新闻(Yahoo、StreetInsider 等)
bright Bright Data(商业爬虫) 购物、金融、天气、本地
oxylabs Oxylabs(商业爬虫) 区域性、本地媒体

当时他的初步判断是:labrador 是一个“白名单”,里面是 Reuters、The Guardian、WSJ、FT、Wikipedia 这些签了内容授权协议的出版商,“除非你拥有一家全国性报纸,否则进不去”。

这句话一出来,独立站圈直接炸了。本来就担心 AI 搜索挤压流量,这下连“被引用”的资格都没了?

但注意,Suganthan 自己也很严谨,他明确说了:这是“一个账号、几天流量”的小样本观察,数字只能当方向,不能当测量。而且他在 7 月就发布了修正。

Resoneo 的研究:数据说了什么

Resoneo 是法国一家 SEO 咨询公司,他们的做法更硬核:用自家开发的 Chrome 插件,在 7 月份抓取了 1,249 条 ChatGPT 回答,并且能从 ChatGPT 的服务器数据流中直接读到每个网页结果是由哪条管道抓取的。

关键发现有三个:

1. 有没有授权合作,服务方式完全一样

Resoneo 对比了 labrador 管道里的页面发现:不管这个网站有没有和 OpenAI 签内容授权协议,被服务的方式完全一样——同样的格式、同样的长度、同样的新鲜度。

换句话说,labrador 不是“付费白名单”,它是 OpenAI 自己的搜索索引,只是额外补充了新闻媒体源和开放科学档案。OpenAI 可以直接访问它,不需要向第三方支付抓取费用——这才是它和商业爬虫管道的本质区别。

2. 免费账号里,自家索引是主力

在 Resoneo 的免费账号数据中:

  • 有明确答案的问题、本地商家、产品类问题,几乎每一次都是通过 labrador 自家索引返回的
  • 新闻类结果,自家索引和 Google 抓取各占一半左右

也就是说,免费用户的日常搜索里,ChatGPT 的自家索引就是主力管道。

3. 付费思考模式里,Google 抓取占大头

在付费账号的思考模式(Thinking mode)中,Resoneo 记录了 16,407 条搜索结果,其中:

  • 约 75% 来自 Google 抓取
  • 约 24% 来自自家索引

这组数据非常有意思:ChatGPT 会根据账号类型和使用模式,动态调配不同的信息管道。付费深度思考模式下,它反而更多依赖 Google 的开放索引。

这对独立站意味着什么?

现在我们可以把整件事串起来了。先别急着欢呼,Neo 给你拆三层:

第一层:小网站确实能进 ChatGPT 的索引

这是最直接、也最解气的结论。Resoneo 明确说了:“数百个没有与 OpenAI 签内容合作的网站,被 OpenAI 自家搜索索引服务的方式,与授权合作伙伴完全相同。”

之前圈子里流传的“ChatGPT 索引 = 大媒体白名单”的说法,可以正式翻篇了。OpenAI 的 labrador 索引覆盖的是开放网络上的内容,不是封闭的授权池。

第二层:但“能进”和“被选中”是两码事

数据还揭示了一个残酷的现实:在付费思考模式下,ChatGPT 有 75% 的结果来自 Google 抓取。

这说明什么?说明 ChatGPT 在很多场景下,本质上还是在“借” Google 的搜索结果。独立站想要在 AI 搜索里露脸,先在 Google 里排上去,依然是基本功——这一点和我们之前反复强调的“AI 搜索时代,Google SEO 没有死”完全吻合。

第三层:不同管道,对应不同优化策略

labrador(自家索引)和 bright/oxylabs(商业爬虫)覆盖的内容生态不同:

  • 自家索引:看重结构化、可解析、事实准确的内容,新闻稿、百科式参考、产品信息都有机会
  • 商业爬虫:抓的是开放网页,Reddit、行业评测、电商详情页都在里面

所以独立站的内容布局不应该只押一条管道。结构化数据、清晰的实体信息、可被机器解析的页面结构,才是通吃所有管道的底层能力。

实操建议:独立站现在该做什么

别光看数据激动,落地才是关键。Neo 给你四个可以直接执行的动作:

1. 别再纠结“要不要和 OpenAI 签约”

很多老板听说“签内容授权协议才能进 ChatGPT”就慌了,甚至有人考虑花冤枉钱去走渠道。这份数据直接说明:没有协议,一样被服务。 把精力省下来,用在内容质量上。

2. 把“被 Google 收录”做到极致

75% 的结果来自 Google 抓取——这句话值得刻在墙上。你的页面如果连 Google 都进不去,AI 搜索里基本也查无此人。基础技术 SEO:robots.txt 别误伤爬虫、站点地图、内链结构、页面加载速度,先全部检查一遍。

3. 用工具验证自己的 AI 可见性

Resoneo 免费提供了他们的 Chrome 插件,Suganthan 也在文章里给了抓取 result_source 字段的浏览器控制台脚本。你可以直接看自己网站的页面,在 ChatGPT 的搜索结果里走的是哪条管道。 数据驱动,别靠猜。

4. 内容上做“机器可读”的强化

既然 labrador 是自家索引,OpenAI 读取你页面的方式就很重要:清晰的标题层级、直接回答问题的开头段落、结构化的产品参数、FAQ 区块,这些都会提高被 AI 索引和引用的概率。

Neo 的解读

这份研究真正值钱的地方,不是“小站也能进 ChatGPT 索引”这个结论本身——虽然它确实很解气——而是它揭示了 AI 搜索的真实运作机制。

你看,之前行业里对 AI 搜索的认知,大多来自“黑盒测试”:研究者狂发几千个 prompt,统计哪个品牌出现在答案里,然后得出各种 share of voice 报告。这种研究永远只能看到“输出”,看不到“机制”。

而 Resoneo 和 Suganthan 这条路不一样——直接读服务器返回的数据流,看每条结果是谁抓的、走哪条管道。这就像你去餐厅吃饭,别人只看“哪道菜最受欢迎”,而他们是直接钻进后厨看“哪口锅炒的”。

我个人的判断是:

第一,AI 搜索的“白名单焦虑”可以放下了,但“内容平庸焦虑”必须拿起来。 索引是开放的,竞争也是开放的。以前你和大媒体比的是 Google 排名,现在比的是“谁的页面更容易被 AI 理解、被 AI 信任”。后者对小站其实更友好——因为大媒体的品牌光环在 AI 那里没有想象中那么值钱。

第二,多管道策略会成为独立站的新常态。 ChatGPT 在不同场景用不同管道,未来 Perplexity、Gemini 大概率也是这个路子。别把所有赌注押在“被 AI 引用”上,Google 排名、直接流量、邮件列表、品牌搜索,每一条都要抓。

第三,也是最重要的:AI 搜索时代,数据透明正在杀死“玄学 SEO”。 以前 SEO 是“我说了算”的玄学,现在有人能直接读出 ChatGPT 的管道分配,未来会有更多这样的逆向工程研究。谁能最早理解机制,谁就能最早吃到红利。独立站老板们,是时候把“关注机制”提上日程了。

别焦虑了,干活吧。你的内容足够好、结构足够清晰,ChatGPT 的索引里,迟早有你的一席之地。